返回资讯列表

FinFIRST基准测试:评估金融信息检索与溯源Agent
2026年9月23日作者:AI铺子编辑部
行业动态
arXiv:2609.25192v1 公告类型:新发布 摘要:金融搜索对 LLM Agent 而言是一项极具挑战性的任务,它不仅要求给出正确的最终答案,还要求具备时效有效的信息检索、权威信源选择、实体与周期对齐、单位与定义一致性,以及为所。
arXiv:2609.25192v1 公告类型:新发布
摘要:金融搜索对 LLM Agent 而言是一项极具挑战性的任务,它不仅要求给出正确的最终答案,还要求具备时效有效的信息检索、权威信源选择、实体与周期对齐、单位与定义一致性,以及为所有结论提供可验证的证据。现有 benchmark 大多只评估最终答案,难以定位错误,也无法判断答案是否有充分依据。为弥补这一空白,我们推出了 FinFIRST(Financial Information Retrieval, Sourcing and Traceability),这是首个通过原子化评分标准(atomic rubrics)联合评估答案与支撑证据的金融 benchmark。FinFIRST 包含 123 项专家编写的任务,难度呈渐进式分布;这些任务基于真实金融场景的聚合模式构建,依托 18 字段分类法、六轴覆盖蓝图、包含 138 个金融信源的注册表、50 余位金融专家的贡献,以及六阶段质量控制流程。每项任务都配有以证据为基础的参考答案包,并拆解为三个维度的原子化标准:原始信息获取、信源验证,以及计算与答案形成。我们在统一的工具设置下评估了 15 种模型配置。Claude-Opus-5 以 87.59% 的原子化得分位居榜首,GPT-5.6-Sol 则以 71.54% 的严格通过率领先。在所有系统中,计算与答案形成环节的表现始终落后于原始信息获取环节。FinFIRST 在将最终答案正确性保留为主要目标的同时,使支撑性的研究过程变得可衡量、可验证且可诊断。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。