返回资讯列表

顺序对、尺度错:审计用于职业 AI 测量的 LLM 评审
2026年10月5日作者:AI铺子编辑部
大模型学术
一项新研究审计了用大语言模型评审职业AI输出的可靠性。测试显示多数评审器排序准确,但可接受率估计与真实劳动者差距悬殊。校准后均值偏差消除,却仍难解释个体评分差异。
arXiv:2610.02492v1 公告类型:新发布
摘要:LLM 评审器(judge)正被越来越多地用于评估 AI 输出是否满足职场要求,但响应排名上的一致并不等同于可接受率或职业层面聚合指标上的一致。我们推出了 O*NET-BENCH——一个源自现有 45,796 份劳动者评级的审计套件,并在 4,501 份测试评级上评估了六个模型家族中共 33 种既有评审器配置。25 种配置的 tie-aware 配对准确率达到至少 0.60,不过一个经训练拟合、仅基于响应的 TF-IDF 基线几乎追平了最强的评审器。尽管排序一致,评审器估计 3.0%–97.9% 的响应可接受,而职业匹配的劳动者这一比例为 61.1%。在某一微调系列中,从逐点打分改为打包式 few-shot/listwise 协议,响应排序有所改善,但在任务和职业层面与劳动者均值的吻合度反而下降;这一反转在预设标准下、于任务与劳动者均不相交的验证集上得到了复现。经交叉验证的校准基本消除了均值偏差,但校准后的分数对个体劳动者评级方差的解释力最高仅为 8.5%。在所研究的标注预算下,预测辅助估计至多带来微小的精度提升。这些结果表明,仅有排序一致不足以支撑职业层面的测量。评审器应针对其分数将要估计的可接受率及聚合指标进行验证。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。