
LLM Agent不懂察言观色?ReAdapt提升社交推理能力
ReAdapt通过结构化社交状态增强LLM Agent,使其能根据关系线索修正决策。该方法引入显式状态表示目标、信念与关系,并在每次观测后执行策略性更新。在包含500个合成社交世界的基准测试中,ReAdapt将反应选择准确率提升8个百分点。
arXiv:2609.25284v1 公告类型:新提交
摘要:社交 Agent 最基础的决策(我是否该回应这条帖子?我该联系谁?)并非纯粹的内容问题。正确的行动往往取决于人与人之间潜在的关系——关系强度、互惠性、共同联系人——而非哪条内容最显眼。标准的 LLM Agent 循环并未显式表示新的关系证据应如何修正 Agent 当前的社交假设,导致当关系线索与内容线索出现分歧时,它们容易做出表面显而易见的选择。我们通过一个关系推理 benchmark 将这种失效模式形式化:500 个合成社交世界,包含好友关系、关注、互动历史和信息流,在两个任务(回应选择)和(热情引荐,即为目标人物找到最佳桥梁联系人)上产生 1,000 条查询。在构造上,约 53% 的查询中,表面显而易见的候选人与基于关系的 oracle 不同,形成了一个“翻转子集”,Agent 必须利用关系证据来修正最初看似合理的选择。我们提出 ReAdapt(Relationship-Adaptive Agent with Policy-driven sTate,即策略驱动状态的关系自适应 Agent),它用一个显式的结构化社交状态 z = (G, B, R, N, D) 增强 ReAct 循环,该状态捕捉目标、信念、关系、规范和披露信息。每次工具观测后,ReAdapt 会运行一个类型化的 Adapt 步骤,更新该状态并发出一个策略操作(继续、切换、放弃或澄清),然后再选择下一个动作。在 Gemini-3-Flash 上,对每个任务分层抽样的 n = 150 条查询子集进行测试,ReAdapt 将热情引荐准确率从 37% 提升至 51%(+14 个百分点),回应选择准确率从 69% 提升至 77%(+8 个百分点)。Oracle 遗憾值分别从 0.260 降至 0.152、从 0.095 降至 0.053。在模型、工具和环境均固定的情况下,这些结果表明,显式的关系状态自适应有助于 LLM Agent 将检索到的社交证据转化为修正后的决策。
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。