返回资讯列表
若 Agent 皆为天使,无需治理:可信工具边界的带外策略强制执行

图源:arXiv cs.AI

若 Agent 皆为天使,无需治理:可信工具边界的带外策略强制执行

2026年8月31日作者:AI铺子编辑部
行业动态

27646v1 Announce Type: new Abstract: 赋予 agent 人类的凭证,它便继承了该用户的权限范围,却不受限制其使用的判断力约束

arXiv:2608.27646v1 Announce Type: new Abstract: 赋予 agent 人类的凭证,它便继承了该用户的权限范围,却不受限制其使用的判断力约束。它可以将所有可访问记录扫入模型上下文,其中隐藏指令引导其下一次调用,而每个请求都保持凭证有效——即使 agent 已超出其职责范围或窃取了机密。Prompt 是一种脆弱的护栏:一个易犯错的推理器同时负责解释任务和执行限制。 我们提出 Out-of-Band Policy Enforcement(OBPE,带外策略执行),一种位于 agent 推理之外的受信边界。它对操作类型和资源进行授权,在后端调用前收窄查询,然后在响应中过滤记录与字段或掩码数值。语义门控可基于参数值或外部状态拒绝或暂留已授权的调用。数据策略所有者设定最大授权范围;agent 策略只能进一步收窄。我们在给定条件下证明,策略计划具有顺序无关性,且 agent 策略无法扩大上限。字段移除覆盖单次执行;掩码和历史规则声明更少。 我们发布一个 HTTP 代理原型,简化自我们的生产系统,其一致性测试将其类型化的 Cedar 策略核心与模型绑定。针对 Jira 和 ServiceNow 模拟环境,我们的 benchmark 比较了有无 OBPE 的 prompt 式 agent 在四个模型上的表现,包含 20 项自适应红队任务。追踪失败定义为:受保护数据进入 agent 上下文、精确值出现在回答中、或禁止的效果已完成。在 3,621 次试验中,失败率从 57.6% 降至 0.2%,按聚类加权降低 41.2 个百分点 [95% CI: 27.7, 54.9];任务完成率从 79.1% 降至 60.9%,而配对的安全且有用完成率上升 21.8 个百分点 [9.5, 35.2]。部分回答重构了从未进入上下文的数值,或将过滤后的行数用作 oracle:塑造单次执行并非非干扰性。写入控制、持久化审批、以及时序和聚合策略不在本次评估范围内。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明