返回资讯列表
前沿模型行动前会寻求安全证据吗?
2026年9月17日作者:AI铺子编辑部
大模型
17865v1 公告类型:new 摘要:前沿模型通常在其对已进入上下文的安全信息作何反应这一方面接受评估
arXiv:2609.17865v1 公告类型:new
摘要:前沿模型通常在其对已进入上下文的安全信息作何反应这一方面接受评估。我们研究的是一个更早的决策点:模型在采取行动之前,是否会选择获取与安全相关的证据。我们提出了 SAFE,这是一个受控 benchmark,其中模型在检索成本、概率、严重程度及呈现方式各不相同的可选证据条件下做出部署决策。在 GPT-5.5、o3、Claude Opus 4.8 和 Claude Sonnet 4.6 上,我们发现了不同的证据获取策略:Opus 几乎默认进行检查,o3 最倾向于跳过检查且对阈值最为敏感,而 GPT-5.5 和 Sonnet 则处于中间状态。检查行为随严重程度显著增加,随检索成本增加而减少,而概率的行为影响则要弱得多:将问题发生的可能性从 10% 提高到 70%,检查率最多变化 21 个百分点。尽管存在这些差异,所有模型在 Stage 1 的推理依据都以期望值推理为主。进一步的成本—义务分解表明,回避行为主要由检索摩擦和对部署收益的明确威胁所驱动,而非由知情后产生的补救义务所驱动。反事实干预揭示了行为与解释之间的进一步错配:证据框架可以在检查边界附近强烈改变决策,却基本未被提及;而概率尽管几乎没有因果影响力,却经常被引用。这些结果表明,部署时的安全性不仅取决于模型如何应对已知风险,还取决于它们是否会获取必要的证据,以确认采取行动是安全的。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。