返回资讯列表
生产级 Text-to-SQL 流水线中 LLM-as-Judge 故障的审计与修复

生产级 Text-to-SQL 流水线中 LLM-as-Judge 故障的审计与修复

2026年9月28日作者:AI铺子编辑部
大模型学术

研究团队审计了生产级 text-to-SQL 流水线中的 LLM-as-judge 环节,发现已部署的 gpt-4o-mini 在富集分歧样本集上与人类标注的 Cohen's kappa 仅为 0.04。

arXiv:2609.30290v1 公告类型:新发布 摘要:生产环境中的 text-to-SQL 流水线通常以 LLM-as-judge 作为最终环节,但这类 judge 与人类标注者之间的一致性从未被真正测量过。当我们检查自己的系统时发现,已部署的 gpt-4o-mini judge 在双人标注金标准(gold)上,于富集分歧样本集(disagreement-enriched set)上的 Cohen's kappa 仅为 0.04,在均匀随机抽查集上为 0.42;在富集集中,它对 77.1% 人类判定为 FAITHFUL 的样本存在过度标记(over-flagging)。其过度标记大多可追溯至我们称之为 GRADE-HALLUCINATION 的单一机制。一个自托管的 Qwen3.6-27B 替代方案(kappa = 0.72)与 Claude Opus 4.7(kappa = 0.71)处于同一水平;尽管 head-to-head 比较在 n = 96 下统计功效不足,但对于部署决策而言这几乎无关紧要,因为 Qwen 每次调用的成本大约仅为前者的 1/300。集成(Ensembling)并非免费午餐。将弱 judge 与强 judge 配对反而降低一致性;而三个强 judge 在一致性路由(unanimity routing)下可达到 kappa = 0.79,自动覆盖率为 89.7%。将同一审计方法应用于域外数据时,按照我们的标注协议,BIRD-financial 中由专家编写的金标准 SQL 有 25.5% 被标记为潜在的金标准 SQL 问题。代码与预注册见 https://github.com/JamesL404/synca-audit。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。