返回资讯列表
TOPAS:面向多Agent LLM推理的工作流感知前缀状态调度系统

TOPAS:面向多Agent LLM推理的工作流感知前缀状态调度系统

2026年8月27日作者:AI铺子编辑部
大模型

25523v1 公告类型:new 摘要:Prefix caching 在多 agent 大语言模型(LLM)推理服务中引入了一个根本性权衡:为某个 agent 保留较长的 system-prompt key-value(KV)cache 可以加速后续调用,但会减少可用于并发请求 batchin...

arXiv:2608.25523v1 公告类型:new 摘要:Prefix caching 在多 agent 大语言模型(LLM)推理服务中引入了一个根本性权衡:为某个 agent 保留较长的 system-prompt key-value(KV)cache 可以加速后续调用,但会减少可用于并发请求 batching 的 GPU 显存。在多阶段工作流中,现有调度器往往优先考虑即时 prefix locality 或整体工作流进度。然而,在共享 KV cache 预算下,单独优化任一目标都可能因下游延迟或频繁的 prefix 替换而延长任务级别的作业完成时间(JCT)。为取得平衡,我们提出了 TOPAS,一种面向任务的 Prefix-Aware 调度器,它联合决策将哪些 agent prefix 保留在 cache 中,以及调度哪些请求执行。TOPAS 通过对候选决策后状态进行评分,权衡每个任务最长剩余服务路径的预期缩减与下游 prefix 复用的近期收益,同时考虑 prefix 迁移和抢占的成本。此外还引入了任务级别的 aging 机制以防止饥饿。我们在 SGLang 框架中实现了 TOPAS,并在三个合成 DAG 和两个 MetaGPT 软件开发工作流上评估了其性能。与每个工作负载和指标下的最优基线相比,TOPAS 在合成工作负载上将 mean/p99 JCT 最高降低 39.8%/49.4%,在 MetaGPT-SOP 上将 mean JCT 降低 9.8%,在 MetaGPT-TL 上将 mean/p99 JCT 降低 22.0%/26.6%。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明