返回资讯列表

图源:arXiv cs.CL
TOPAS:面向多Agent LLM服务的Workflow-Aware前缀状态调度方案
2026年8月27日作者:AI铺子编辑部
大模型
25523v1 公告类型: new 摘要: Prefix caching 在多 agent 大语言模型(LLM)推理服务中引入了一个根本性的权衡:为某个 agent 保留较长的 system-prompt key-value(KV)cache 可以加速后续调用,但会减少可用于 batch 并发...
arXiv:2608.25523v1 公告类型: new
摘要: Prefix caching 在多 agent 大语言模型(LLM)推理服务中引入了一个根本性的权衡:为某个 agent 保留较长的 system-prompt key-value(KV)cache 可以加速后续调用,但会减少可用于 batch 并发请求的 GPU 显存。在多阶段工作流中,现有调度器往往优先追求即时的 prefix locality 或整体工作流进度。然而,在共享 KV cache 预算下,孤立优化任一目标都可能通过下游延迟或频繁的 prefix 替换而延长任务级别的作业完成时间(JCT)。为取得平衡,我们提出了 TOPAS,一种面向任务的 Prefix-Aware 调度器,它联合决策哪些 agent prefix 保留在 cache 中,以及哪些请求进入执行。TOPAS 通过对候选决策后状态进行评分,权衡每个任务最长剩余服务路径的预期缩减与近期下游 prefix 复用的收益,同时考虑 prefix 迁移和抢占的代价。我们还引入了任务级别的 aging 机制以防止饥饿。TOPAS 在 SGLang 框架中实现,并在三个合成 DAG 和两个 MetaGPT 软件开发工作流上进行了评估。与每个工作负载和指标下表现最优的基线相比,TOPAS 在合成工作负载上将 mean/p99 JCT 最高降低 39.8%/49.4%,在 MetaGPT-SOP 上降低 mean JCT 9.8%,在 MetaGPT-TL 上降低 mean/p99 JCT 22.0%/26.6%。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。