返回资讯列表
思考消耗 Token:结构化何时值得付出代价

图源:arXiv cs.AI

思考消耗 Token:结构化何时值得付出代价

2026年9月1日作者:AI铺子编辑部
行业动态

27506v1 发布类型: 新论文 摘要: 为语言模型添加推理结构使其能够搜索、验证和修正,但这些操作本身会消耗本应妥善利用的预算

arXiv:2608.27506v1 发布类型: 新论文 摘要: 为语言模型添加推理结构使其能够搜索、验证和修正,但这些操作本身会消耗本应妥善利用的预算。本文探讨是否存在一个 token 预算阈值:低于该阈值时,规划与验证的开销会损害性能;高于该阈值时则能提升性能。我们在 FinQA 和 TAT-QA 金融推理任务上评估了两个系统,使用 GPT-5.4 mini,涵盖从 250 到 42,000 个输出等效 token 的 14 个预算层级。第一个系统是单体架构,即单次 LLM 调用。第二个是经过验证的搜索架构,增加了规划、盲标签检查(label-blind checking)和修复能力。我们运行了 1,000 个案例,共计完成 28,000 个实验单元。在最低的两个层级上,两个系统均得分为 0%,因为两者都无法容纳完整的 prompt。在 1,000 token 时,单体架构达到 18% 的准确率,而经过验证的搜索得分接近 0%,因为规划开销没有留出回答的空间。从 1,500 token 起,经过验证的搜索超越单体架构并保持稳定优势,在最高层级达到约 44%,而单体架构约为 40%。交叉点出现在 1,000 至 1,500 个输出等效 token 之间,经严格的 intersection-union 检验确认(两端点均满足 $p \le 0.001$)。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明