返回资讯列表
同样数量,不同答案:语言模型中的数值表示不变性

同样数量,不同答案:语言模型中的数值表示不变性

2026年9月23日作者:AI铺子编辑部
大模型

arXiv:2609.25009v1 公告类型:新发布 摘要:数值等价的文字题,无论某个量以小数、分数、百分数、数字单词、科学记数法还是精确换算后的单位表示,都应产生相同的规范答案。

arXiv:2609.25009v1 公告类型:新发布 摘要:数值等价的文字题,无论某个量以小数、分数、百分数、数字单词、科学记数法还是精确换算后的单位表示,都应产生相同的规范答案。我们生成了 3,600 道精确有理数题目和 8,600 个提示,涵盖五个保持恒等性的变换族,并对五个开源权重系统进行了评估。在经过一次固定的语法审计(在不使用 LLM 评判的情况下规范化常见答案形式)之后,规范准确率为 0.969-0.996,但轨道正确率降至 0.848-0.981,轨道不变性降至 0.851-0.981;不变但错误的轨道占比至多 0.003。严格解析器出现的大幅崩溃,主要源于乘法形式的科学记数法超出了所实现的数字语法范围,这说明评估器接口问题可能伪装成推理失败。另一种 distinct 的语义病理现象依然存在:Mistral Small 4 在单位换算输入上的得分为 0.699,并产生了 265 个与标签相差精确 10 的幂次的错误。在一项单独的 9,000 次调用实验中,我们为各对比组分配了相等调用次数,结果显示在低错误子集上,表示共识并未优于改写共识,反而产生了明显更多的误报。随附的辅助存档包含冻结的 benchmark、评估与审计记录、共识原始响应、清单、分析代码以及一键构建论文的命令。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明