返回资讯列表

NAQD Env:语言Agent选择性退出能力基准测试
2026年10月1日作者:AI铺子编辑部
大模型学术开源
研究团队推出合成基准NAQD-Env,用于检验语言智能体在证据、权限或指令变化时的选择性退出与恢复能力。该环境通过确定性参考策略区分尝试违规与获准违规,并在冻结场景下测试多模型。结果显示开源模型撤回召回率极低且几乎无法恢复。
arXiv:2609.38460v1 公告类型:新发布
摘要:当证据发生变化、权限被撤销或收到停止指令时,语言智能体必须修正已规划的动作。理想的响应是选择性的:暂停受影响的动作,保留未受影响的工作,并在充分修复后才恢复执行。我们推出 NAQD-Env,这是一个合成环境,用于基于确定性参考策略,针对显式的证据依赖、授权依赖与约束依赖来评估这些决策。十一种依赖族支持在开发结构、留出(held-out)依赖族以及留出结构组合上进行评估。指标体系区分了"尝试违规"与"被模拟执行门所允许的违规",并联合报告策略一致性、任务价值、撤回(withdrawal)、恢复(resumption)与事件上报等指标。我们在 350 个冻结场景下,评估了来自两个模型家族的三个开源指令微调模型在三种提示条件下的表现,在执行门回放前共产生 3,150 个模型-提示回合(episode)。在所有报告的条件中,撤回召回率最高仅为 0.06;在有资格恢复的机会中未观察到任何有效恢复;且仅有一个回合与完整参考策略完全匹配。在 NAQD 提示下,Qwen2.5-7B 的不安全尝试回合少于 Qwen2.5-3B 和 Llama-3.1-8B,但完成的有用工作也更少,且对未受影响动作的保留准确性更低。探索性的监督微调探测实验将 Qwen2.5-3B 的决策准确率从 0.45-0.54 提升至 0.83-0.92;独立的诊断分析揭示了因课程遗漏导致的不恰当撤回,以及事件上报能力的丧失。这些结果提示,应将选择性撤回作为智能体可靠性的一个独立组成部分加以评估。该设定衡量的是在受信任的结构化输入下的策略应用能力,并不能证明其在真实世界中的遏制能力或信源核验能力。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。