返回资讯列表
我们对 LLM 有何期待?梳理 LLM 基准测试的设计
2026年9月18日作者:AI铺子编辑部
大模型
19182v1 公告类型:新提交 摘要:Benchmark 是评估和传达大语言模型(LLM)进展的核心方式
arXiv:2609.19182v1 公告类型:新提交
摘要:Benchmark 是评估和传达大语言模型(LLM)进展的核心方式。然而,仅凭模型排名,我们很难了解评估要求本身正在发生怎样的变化。日益丰富的 benchmark 类型提供了另一种视角:研究者期望 LLM 完成什么任务,以及他们将何种表现视为成功。我们系统梳理了 2022 年 1 月至 2026 年 8 月期间 arXiv 上提交、引入或更新评估资源的 14,767 篇论文。通过分阶段筛选和自动化全文编码,我们考察了目标系统与领域、评估材料与条件,以及评分机制的变化。整体来看,研究越来越强调行动、交互和专业应用,而成熟的设计元素与新兴设计元素往往并存。模型参与的演进也并不均衡:基于 LLM 的评分在 agent 与非 agent 两类研究中都呈增长趋势,但在近期批次中,模型生成的评估材料并未出现类似的持续上升。这些发现揭示了公共研究如何将能力预期转化为具体测试与成功标准。随着 AI 开始参与构建测试、执行任务和评判回答,这也引出一个问题:评估范围的扩大,究竟是在提供更多独立证据,还是在复制参与其中的模型所固有的偏好与盲区?
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。