返回资讯列表
LLM Judge Panel 的停止机制与路由策略

LLM Judge Panel 的停止机制与路由策略

2026年8月21日作者:AI铺子编辑部
大模型

19802v1 发布类型:新论文 摘要:LLM 评估流程通常面临众多候选 judge 的选择:通用 LLM-as-a-judge 提示、reward model、安全分类器、置信度变体,以及任务专用验证器

arXiv:2608.19802v1 发布类型:新论文

摘要:LLM 评估流程通常面临众多候选 judge 的选择:通用 LLM-as-a-judge 提示、reward model、安全分类器、置信度变体,以及任务专用验证器。部署时的核心问题不仅是哪个 judge 最优,还包括应在哪些样本上调用哪些 judge,以及何时应停止组建评审 panel。我们将 judge panel 的设计形式化为一个基于角色的条件分配问题。借助小规模标注审计集、声明的切片(slice)以及 judge 调用成本,该方法估计相对于目标的角色类型:副本(copies)不增加条件信息,互补项(complements)提升全局 panel 表现,而专家(specialists)仅在特定切片上有帮助。这些角色导出一项策略:剔除副本、全局添加互补项、条件路由专家,并在验证增益低于阈值时停止。在推理、代码、安全、偏好、reward model、摘要和数学等多类审计任务中,该方法与单一 judge、扁平 panel、匹配多样性启发式、全量调用堆叠、可靠性陪审团以及节俭级联(frugal cascade)等方法进行了对比。最终得到一张 judge 调用的 regime 图谱:在可部署切片上路由专家,在饱和验证器 regime 中停止调用,当风险收益值得成本时保留宽泛集成,并忽略条件副本。输出结果为一份可复用、可审计的调用计划,用于下一批评估任务。

来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明