返回资讯列表
并非所有AI Agent都一样:资源与性能动态分析
2026年9月18日作者:AI铺子编辑部
行业动态
19947v1 公告类型:新发布 摘要:基于 LLM 的 AI Agent 通过迭代推理与工具执行来处理用户请求,其中往往涉及调用远程 LLM API 并配合本地工具容器
arXiv:2609.19947v1 公告类型:新发布
摘要:基于 LLM 的 AI Agent 通过迭代推理与工具执行来处理用户请求,其中往往涉及调用远程 LLM API 并配合本地工具容器。这种执行模式使得 Agent 服务的优化变得困难,因为延迟、本地资源需求以及容器瓶颈会在多个请求之间相互交织。然而,当前的 Agent 生态系统在运行时对资源动态几乎不加考量,导致宝贵资源被大量浪费。本文针对三种代表性任务——检索增强问答(retrieval-augmented question answering)、网页搜索(web search)和软件编码(software coding)——分析了 AI Agent 的资源交织特性。为此,我们刻画了在并发处理多个请求与任务时,延迟相对于资源动态的变化特征。测量结果表明,Agent 的行为因任务不同而差异巨大,即便是同一工具,其资源动态也可能存在显著差别。我们还发现,并发运行多个请求会暴露出与任务相关的资源动态瓶颈,例如 CPU、磁盘 I/O 和内存。此外,我们揭示出更快的 LLM 响应或更多的 CPU 核心并不总能加速 Agent。基于这些观察,我们展示了利用任务资源动态的新优化机会:CPU 感知的工具准入(CPU-aware tool admission)与任务感知的 CPU 分配(task-aware CPU allocation)。实验结果显示,对于 CPU 敏感的 Agent 任务,延迟改善了约 5.4 倍;与原生 Agent 相比,多任务平均延迟降低了约 32%。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。