返回资讯列表
身份不止于记忆:面向部署中 AI Agent 持久身份的基准测试

身份不止于记忆:面向部署中 AI Agent 持久身份的基准测试

2026年9月16日作者:AI铺子编辑部
行业动态

13637v1 公告类型:新发布 摘要:持久化 Agent 需要能够区分"可回忆的身份事实"与"所表达和实际执行的身份事实"的评估方法

arXiv:2609.13637v1 公告类型:新发布 摘要:持久化 Agent 需要能够区分"可回忆的身份事实"与"所表达和实际执行的身份事实"的评估方法。我们推出 PAI-Bench,这是一个与服务商无关的 benchmark,用于评估对版本化、更新受治理的身份契约的保真度。该 benchmark 将回忆、组合、行为执行、抵抗、持久性、谱系和角色条件更新分离开来,同时将评分 oracle 置于目标进程之外。两轮冻结测试活动覆盖了十六个合成档案、三十二个探针和三个独立初始化的目标配置,共保留 1,536 条响应。一项独立于评判者的字面审计发现,48/48 条原子响应中均包含直接父标识符,但在隐式自画像中仅 1/48 包含该标识符。在八个档案上,在相同的四句话指令下,显式字段提示使三个身份标识符的联合出现率从 0/8 提升至 7/8。另一项独立的启动主体标签替换实验,在父标识符仍然缺失的情况下,将完整称谓的出现率从 1/8 提升至 7/8。这些对比揭示了在被测部署中存在的提示依赖型组件选择,以及组件对启动提示的特定敏感性。重放相同的因子响应还发现,Claude 的头条均值比 Astra 低 12.5 个百分点,这表明评估器敏感性与目标行为是相互独立的。这些研究在每个条件下使用单一目标样本,并进行了事后审计和后续实验。PAI-Bench 提供了一个可复现的评估协议,用于将事实可用性、身份表达和行为执行作为身份契约保真度的不同维度进行测量。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明