返回资讯列表

GLIDE:面向异构 LLM Agent 的通用逐层内在分布评估方法
2026年9月29日作者:AI铺子编辑部
大模型学术
研究团队提出面向异构大模型智能体的通用逐层评估框架 GLIDE。该方法从逐层残差一致性提取内在步骤证据,结合智能体近期表现校准为悲观奖励,为分支选择提供跨智能体价值信号。实验显示其在多跳推理、序贯决策与符号逻辑任务上同步提升性能。
arXiv:2609.32295v1 公告类型:new
摘要:LLM agent 需要可靠的步骤级评估来比较候选分支并有效分配计算资源。然而,轻量级评估仍然具有挑战性。外部验证器会带来额外的推理成本,而由 agent 生成的置信度或自评估分数可能存在校准偏差,尤其是当候选由异构 agent 生成时。我们提出了面向 LLM agent 的\textbf{G}eneralized \textbf{L}ayer-wise \textbf{I}ntrinsic \textbf{D}istributional \textbf{E}valuation(\textbf{GLIDE})。\textsc{GLIDE} 从逐层残差一致性中提取内在步骤证据,用于衡量局部残差更新是否持续支持由候选步骤引发的全局残差变化。它将该证据与生成 agent 的近期分数分布进行校准,并将其转换为悲观奖励,从而联合考虑绝对残差证据和相对该 agent 的表现水平。该奖励为 MCTS 分支选择提供跨 agent 的价值信号,而归一化预测不确定性则用于指导自适应分支。在多跳推理、序贯决策和符号逻辑任务上的实验表明,\textsc{GLIDE} 无需外部验证器或任务特定监督,即可提升任务性能、步骤级排序质量和计算效率。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。