返回资讯列表
Benchmark Radar:AI基准测试与评估的动态数据库与搜索引擎
2026年9月12日作者:AI铺子编辑部
学术
11115v1 公告类型:新发布 摘要:从事大型语言模型(LLM)及其他 AI 系统评测的研究人员与开发者,需要找到相关的评测方法、定位其 benchmark 数据集与代码,并理解已公布分数背后的具体设置
arXiv:2609.11115v1 公告类型:新发布
摘要:从事大型语言模型(LLM)及其他 AI 系统评测的研究人员与开发者,需要找到相关的评测方法、定位其 benchmark 数据集与代码,并理解已公布分数背后的具体设置。我们推出 Benchmark Radar——一个持续更新的数据库与搜索引擎,用于检索和发现 AI benchmark,涵盖 LLM 评测、agentic 与工具使用(tool-use)benchmark、编程、推理、安全以及领域专用评测。该系统将每日发现的 benchmark 论文、代码仓库、数据集与发布版本,与可搜索的 benchmark 目录、模型卡(model card)与技术报告中的提及记录,以及分数历史相结合。系统保留来源标识与引用信息,方便读者核查候选 benchmark 及其评测证据。每日发现流程覆盖 37 个来源:13 个直接连接器与 24 个一手研究及工程动态源。目录包含来自 4 个 benchmark 目录的 1,283 条来源记录,以及 790 条记录上的 12,916 条数值观测。我们介绍了数据收集与检索方法,对完整目录进行了审计,并考察了 benchmark 饱和现象、采用趋势以及分数比较的局限。文中通过一个完整示例演示了如何开展现有技术(prior-art)检索,展示在设计新评测时如何查询目录并核查 benchmark 证据。我们发布了 Web 仪表盘,其中包含 benchmark 排行榜、分数与实测使用量对比的 Pareto 前沿视图、饱和度与趋势视图、每日动态、可下载的证据数据、用于离线查询的命令行界面(CLI),以及可复现的分析流程。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。