返回资讯列表
评估 LLM Agent 认知深度的操作标准

评估 LLM Agent 认知深度的操作标准

2026年10月6日作者:AI铺子编辑部
大模型学术

研究团队提出评估 Agentic 大语言模型认知深度的五项操作标准。该框架从轨迹层面刻画系统的上下文敏感性、时间连续性、多模态协调、自适应交互与元认知监控。它支持将主流基准测试扩展为逐项诊断,为构建和验证相关能力提供实用路径。

arXiv:2610.04168v1 公告类型:新提交 摘要:Agentic 大语言模型(LLM)系统通常被实现为在一个循环中包含规划(Planning)、记忆(Memory)、工具(Tools)和控制流(Control Flow)的 LLM。这种以应用为核心的视角将 agentic LLM 研究与可部署系统联系起来,但除端到端任务成功率之外,这类系统应如何评估仍属开放问题。在此视角基础上,我们将 agentic 认知深度(agentic cognitive depth)定义为跨五项操作性标准的轨迹级画像。该画像包含上下文敏感性($C$)、时间连续性($T$)、多模态协调($M$)、自适应交互($A$)和元认知监控($Mc$)。前四项标准衡量控制流、记忆、工具和规划在整条轨迹中的使用效果;第五项则衡量系统是否对完整运行过程进行监控与调节。针对每项标准,我们给出操作性代理指标和扰动流程,并将该画像与 agent 的世界模型联系起来。我们提供了所需的结构,用于将 GAIA、SWE-bench、WebArena 和 TRIP-Bench 等 benchmark 扩展为按标准逐项诊断。符号验证器、结构化记忆、规划器耦合和工具约束为构建和测试这些能力提供了实用途径。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。