返回资讯列表

FinFIRST基准测试:评估金融信息检索与溯源Agent能力
2026年9月23日作者:AI铺子编辑部
行业动态
arXiv:2609.25192v1 公告类型:新发布 摘要:金融搜索对 LLM Agent 而言是一项极具挑战性的任务,它不仅要求最终答案正确,还要求信息检索在时间上有效、来源权威可靠、实体与期间对齐、单位与定义一致,并且所有结论都有可。
arXiv:2609.25192v1 公告类型:新发布
摘要:金融搜索对 LLM Agent 而言是一项极具挑战性的任务,它不仅要求最终答案正确,还要求信息检索在时间上有效、来源权威可靠、实体与期间对齐、单位与定义一致,并且所有结论都有可验证的证据支撑。现有 benchmark 大多只评估最终答案,难以定位错误,也无法判断答案是否有充分依据。为填补这一空白,我们推出了 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),这是首个通过原子化评分标准(atomic rubrics)联合评估答案与支持证据的金融 benchmark。FinFIRST 包含 123 个专家编写的任务,覆盖由易到难的渐进难度区间;这些任务基于真实金融场景的聚合模式构建,并依托 18 字段分类体系、六轴覆盖蓝图、包含 138 个金融来源的注册库、50 余位金融专家的贡献,以及六阶段质量控制流程。每个任务都配有基于证据的参考答案包,并拆解为三个维度的原子化标准:原始信息获取、来源验证,以及计算与答案形成。我们在统一的工具设置下评估了 15 种模型配置。Claude-Opus-5 取得了最高的原子化得分 87.59%,而 GPT-5.6-Sol 获得了最高的严格通过率 71.54%。在所有系统中,计算与答案形成环节的表现始终落后于原始信息获取。FinFIRST 在将最终答案正确性保留为核心目标的同时,使支撑性的研究过程变得可度量、可验证、可诊断。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。