返回资讯列表

LLM Agent 轨迹预测可靠性审计:测试驱动方法揭示目标校准迁移在同一基准内持续存在
2026年9月23日作者:AI铺子编辑部
大模型
arXiv:2609.25647v1 公告类型:新发布 摘要:基于轨迹预测早期结果,可以在结果变得足够可预测时终止运行,从而降低 agent 评估的相关成本——前提是预测器的置信度经过了正确校准。
arXiv:2609.25647v1 公告类型:新发布
摘要:基于轨迹预测早期结果,可以在结果变得足够可预测时终止运行,从而降低 agent 评估的相关成本——前提是预测器的置信度经过了正确校准。当预测器被应用于一个从未训练过的 agent 时,校准可能面临风险,但目前尚不清楚这种迁移失败是广泛存在于各 agent 系统之间,还是集中于特定的目标 agent/head 组合。我们利用公开的 SWE-bench Verified 轨迹和一个冻结的双 head(dual-head)早期结果预测流水线,开展了留一 agent 校准审计、共享预测器的留二 agent 对照、oracle 先验校正,以及覆盖训练队列、任务重采样、任务半分、jackknife 和阈值的稳健性测试。固定 scaffold 的 TerminalBench 分析作为预注册的边界检验。结果并不支持广泛的同预测器两两异质性:校正后 gap 差异的中位数分别为 0.0180(SUCCESS head,45 对)和 0.0385(FAILURE head,35 对),且任一 head 均未达到预注册的异质性标准。有两个特定组合——gpt-5-mini/SUCCESS 和 claude-opus-4.6/FAILURE——表现出持续的校准迁移误差(校正后 gap 中位数分别为 0.1377 和 0.1107),且在任一冻结对照下均未出现符号反转。TerminalBench 未能实现跨 benchmark 的复现:成功目标产生了零决策(INDETERMINATE),失败目标也未满足预注册的持续性标准。因此,在单一冻结环境中确实可能存在强烈的目标特异性校准迁移误差,但现有证据尚不能证明该误差是模型固有的,也不能证明其可跨 benchmark 泛化。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。