返回资讯列表

首 Token 并非定论:只读不生成 LLM 评审的隐性成本
2026年10月2日作者:AI铺子编辑部
大模型学术
一项新研究揭示了大型语言模型评审中一种隐蔽的测量缺陷。仅通过首个token的logits读取裁决结果会单向夸大位置偏差,使其数值实际上成为上界。该扭曲源于部分模型未以裁决token开头,导致测量者被误导,而评审准确率几乎不受影响。
arXiv:2610.00054v1 公告类型:新发布
摘要:从 LLM judge 第一个生成 token 的 logits 中读取其裁决结果,成本低廉、无需实际生成,而这正是受限解码(constrained decoding)和似然评分(likelihood-scoring)评测框架所采用的做法。我们发现,这种读取方式会单向扭曲位置偏差(position bias):在我们测试的所有条件下,它都会高估位置偏差,因此以此方式获得的数值实际上相当于上界。其机制在于,judge 并不总是以裁决 token 作为首个输出——在三个 Qwen3 judge 上,有 12% 至 49% 的样本对如此,而在 Llama-3.1-8B 和 Phi-3.5-mini 上这一比例低于 3%;在这些样本对上强行读取结果时,返回的是先展示的那个回答,而非真正的判断。在汇总了 924 个 judge 未给出裁决的样本对后,当交换两个回答的顺序时,强行读取的结果在 89.7% 的情况下发生翻转,而经过完整生成后再读取的翻转率为 47.5%(配对差值 +0.422,95% 置信区间 [+0.365, +0.467])。
这种扭曲具有测量特异性:它使位置偏差移动了 42 个百分点,而在十个条件中的七个条件下,judge 准确率的变动不足一个百分点。因此,它误导的是审计 judge 的人,而非使用 judge 的人。还存在第二种规模较小的失效模式:即便 judge 确实以裁决 token 开头,有时也会先给出一个字母,却在推理过程中转向另一个选项——这种情况在 0 至 5.5% 的样本对中出现,其发生率与合规率(compliance)无相关性。我们建议,在报告任何位置偏差数据的同时,应一并报告 judge 以裁决 token 作为首个输出的比率——这一指标仅需一次前向传播(forward pass)即可计算,且无需任何标签。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。