返回资讯列表
GrowPage:按需 KV 预算管理,实现高效 LLM 推理服务

图源:arXiv cs.AI

GrowPage:按需 KV 预算管理,实现高效 LLM 推理服务

2026年9月4日作者:AI铺子编辑部
大模型

03494v1 Announce Type: new Abstract: 长输出推理使 key-value (KV) 缓存成为高效 LLM serving 的关键内存瓶颈

arXiv:2609.03494v1 Announce Type: new Abstract: 长输出推理使 key-value (KV) 缓存成为高效 LLM serving 的关键内存瓶颈。现有的 KV 压缩方法通常依赖预定义的 per-request 预算,仅调整保留哪些 KV 状态,而总容量在解码过程中保持固定。然而,推理工作负载表现出显著的需求变化:不同请求需要不同的 KV 容量,且单个请求的 attention 需求在生成过程中不断演变。我们提出 \textbf{GrowPage},一种按需 KV 预算框架,将 KV 容量视为运行时资源。GrowPage 维护轻量级的双时间尺度 query 摘要,以捕获近期和长期的 attention 行为,并利用其相对 attention working set 来估计需求演变。在每个容量边界处,GrowPage 要么在当前分配内压缩 KV 状态,要么在出现更广泛需求时获取额外的物理 page。通过与 PagedAttention 的 page 级内存抽象集成,GrowPage 保持了 continuous batching 和 prefix caching。在多个模型的推理 benchmark 上的实验表明,GrowPage 在现有方法之上实现了更优的性能-吞吐量权衡。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明