返回资讯列表
GrowPage:面向高效 LLM 推理服务的按需 KV 缓存预算管理

图源:arXiv cs.AI

GrowPage:面向高效 LLM 推理服务的按需 KV 缓存预算管理

2026年9月5日作者:AI铺子编辑部
大模型

03494v1 Announce Type: new Abstract: 长输出推理使得 key-value (KV) cache 成为高效 LLM serving 的关键内存瓶颈

arXiv:2609.03494v1 Announce Type: new Abstract: 长输出推理使得 key-value (KV) cache 成为高效 LLM serving 的关键内存瓶颈。现有的 KV 压缩方法通常依赖预定义的 per-request 预算,仅调整保留哪些 KV 状态,使得总容量在解码过程中保持固定。然而,推理工作负载表现出显著的需求变化:不同请求需要不同的 KV 容量,且单个请求的 attention 需求在生成过程中会动态演变。我们提出 GrowPage,一种按需 KV 预算框架,将 KV 容量视为运行时资源。GrowPage 维护轻量级的双时间尺度 query summary,以捕获近期和长期的 attention 行为,并利用其相对 attention working set 来估计需求演变。在每个容量边界处,GrowPage 要么在当前分配内压缩 KV 状态,要么在出现更广泛需求时获取额外的物理 page。通过与 PagedAttention 的 page-level 内存抽象集成,GrowPage 保持了 continuous batching 和 prefix caching。在多个模型的推理 benchmark 上的实验表明,GrowPage 在现有方法之上实现了更优的性能-吞吐量权衡。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明