返回资讯列表
当 LLM Agent 读不懂氛围:ReAdapt 提升关系社交推理能力

当 LLM Agent 读不懂氛围:ReAdapt 提升关系社交推理能力

2026年9月24日作者:AI铺子编辑部
大模型学术产品

研究团队推出 ReAdapt 框架,旨在增强大语言模型智能体的关系社交推理能力。其核心做法是在 ReAct 循环中加入结构化社交状态,并根据工具反馈动态更新状态与策略。在包含 500 个合成社交世界的基准测试中。

arXiv:2609.25284v1 公告类型:新发布 摘要:社交 Agent 最基础的决策(我是否应该回应这条帖子?我应该联系谁?)并非纯粹的内容问题。正确的行动往往取决于人与人之间潜在的关系——关系强度、互惠性、共同联系人——而不是哪条内容最显眼。标准的 LLM Agent 循环并未显式表示新的关系证据应如何修正 Agent 当前的社交假设,因此当关系线索与内容线索出现分歧时,它们容易做出表面显而易见的选择。我们通过一个关系推理 benchmark 将这种失效模式形式化:该 benchmark 包含 500 个合成社交世界,涵盖好友关系、关注关系、互动历史和信息流,围绕两项任务(反应选择与热情引荐,即找到通往目标人物的最佳桥梁)生成 1,000 个查询。按设计,约 53% 的查询中,表面显而易见的候选人与基于关系的 oracle 答案不同,从而构成一个"反转子集",Agent 必须利用关系证据来修正最初看似合理的选择。我们提出 ReAdapt(Relationship-Adaptive Agent with Policy-driven sTate),它在 ReAct 循环中增加一个显式的结构化社交状态 z = (G, B, R, N, D),用于捕捉目标、信念、关系、规范和披露信息。每次工具观察之后,ReAdapt 会执行一个带类型的 Adapt 步骤,更新该状态并发出一个策略操作(继续、切换、放弃或澄清),然后再选择下一个动作。在 Gemini-3-Flash 上,对每个任务按分层抽样选取 n = 150 个查询进行测试,ReAdapt 将热情引荐的准确率从 37% 提升至 51%(+14 个百分点),将反应选择的准确率从 69% 提升至 77%(+8 个百分点)。Oracle regret 分别从 0.260 降至 0.152、从 0.095 降至 0.053。在模型、工具和环境保持不变的前提下,这些结果表明,显式的关系状态自适应有助于 LLM Agent 将检索到的社交证据转化为修正后的决策。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。