
图源:arXiv cs.AI
CIFQA:面向金融查询的确定性工具驱动多Agent LLM框架
26114v1 发布类型: 新论文 摘要: 计算密集型金融问答需要在结构化利率、时间条件、数值公式和基于规则的约束之间进行精确推理
arXiv:2608.26114v1 发布类型: 新论文
摘要: 计算密集型金融问答需要在结构化利率、时间条件、数值公式和基于规则的约束之间进行精确推理。尽管大语言模型(LLM)在自然语言任务上表现强劲,但在解决多步金融计算时,它们常常生成数值错误却看似合理的答案。为解决这一局限性,我们提出了 CIFQA(Calculation-Intensive Financial Query Answering,计算密集型金融查询问答),一种用于金融问答的确定性工具 grounding 多智能体 LLM 框架。CIFQA 将语言理解与数值执行相分离,指派专门的智能体分别负责查询解读、路由、参数提取、计算规划和响应生成,同时由基于 Python 的确定性工具执行金融计算和规则应用。我们将 CIFQA 实例化用于定期存款查询问答,并在一个精心策划的定期存款查询 benchmark 上对其进行评估。CIFQA 在计算密集型查询上达到 95.54% 的准确率,总体准确率为 90.87%,即使直接 LLM 基线模型被提供了完整公式、利率表和 benchmark 说明,CIFQA 仍大幅优于这些基线。消融研究表明,确定性组件如精确利率查询、存期计算、滚动年调整和提前支取逻辑对性能贡献关键。值得注意的是,在 CIFQA 中运行的 17B 开源 backbone 表现优于使用相同金融信息评估的规模大得多的 frontier model,这表明架构设计比模型规模更是数值可靠性的决定性因素。虽然 CIFQA 在定期存款查询上进行了评估,但它为计算密集型金融推理任务提供了一个可泛化的框架。
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。