返回资讯列表

LLM 偏好推理中的可行动不确定性评估:询问、放松还是行动?
2026年10月5日作者:AI铺子编辑部
大模型学术
研究团队提出“可行动模糊性”框架,规范大模型在不确定偏好下应询问、放松约束还是直接行动。基于求解器构建涵盖分配、排期等四类场景的基准,模型普遍难以判断何时无需干预,常在已有合理方案时仍多此一举。结果显示。
arXiv:2610.03102v1 公告类型:新发布
摘要:LLM Agent 可以识别不确定性,却仍然可能选错下一步:在行动已有充分依据时选择发问,或在必须修改约束条件时反而寻求澄清。我们将这种困境形式化为"可行动的模糊性"(actionable indeterminacy):当某个被接受的操作在所有可行偏好或目标下均被共享时,应采取行动;当每种可能性都可行但不存在共享操作时,应寻求澄清;当请求不可行时,则提出最小成本的允许约束修复方案。我们构建了一个基于求解器的 benchmark,涵盖物品分配、会议安排、公寓选择与稳定匹配四个场景。匹配对(matched pairs)共享同一来源,但改变是否需要干预,评估则区分决策正确性、匹配对可靠性与完全正确响应。我们的发现揭示了一个反复出现的难点——识别何时无需干预:模型能够识别需要澄清或修复的情形,却在已存在合理操作时仍进行干预。正确的决策标签也无法保证可用的操作、问题或修复方案。关键在于,响应要求不仅决定决策的表达方式,还会改变决策本身。明确所需内容能显著提升完全正确响应率,并可能改变干预决策,即便输出本身已可解析。这些发现表明,可靠的 Agent 能力不仅需要识别不确定性,更需要在必要时才干预,并将选定的下一步转化为可验证的响应。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。