返回资讯列表
Token 换思考:结构化何时物有所值

图源:arXiv cs.AI

Token 换思考:结构化何时物有所值

2026年8月31日作者:AI铺子编辑部
行业动态

27506v1 公告类型:new 摘要:为语言模型添加推理结构使其能够搜索、验证和修正,但这些操作本身也会消耗本应妥善利用的预算

arXiv:2608.27506v1 公告类型:new 摘要:为语言模型添加推理结构使其能够搜索、验证和修正,但这些操作本身也会消耗本应妥善利用的预算。本文探究是否存在一个 token 预算阈值——低于该阈值时,规划与验证的开销会损害性能;高于该阈值时则能带来助益。我们在 FinQA 和 TAT-QA 金融推理任务上评估了两个系统,使用 GPT-5.4 mini,覆盖从 250 到 42,000 个输出等效 token 的 14 个预算层级。第一个系统是单体架构(monolith),即单次 LLM 调用。第二个是经过验证的搜索架构,增加了规划、盲标签检查(label-blind checking)和修复能力。我们运行了 1,000 个案例,共计完成 28,000 个单元。两个系统在最低的两个层级上均得分为 0%,因为两者都无法容纳完整 prompt。在 1,000 token 时,单体架构达到 18% 的准确率,而经过验证的搜索得分接近 0%,因为规划开销没有为答案留出空间。从 1,500 token 起,经过验证的搜索超越单体架构并保持稳定优势,在最高层级达到约 44%,而单体架构约为 40%。交叉点出现在 1,000 至 1,500 个输出等效 token 之间,严格的 intersection-union 检验确认了这一结果(两端点均满足 $p \le 0.001$)。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明