返回资讯列表
Tensor Parallelism 还是 KV 压缩?内存受限 LLM 推理的两种扩容路径对比

图源:arXiv cs.AI

Tensor Parallelism 还是 KV 压缩?内存受限 LLM 推理的两种扩容路径对比

2026年8月27日作者:AI铺子编辑部
大模型

23962v1 Announce Type: new Abstract: 当 LLM serving 部署耗尽 KV cache 空间时,通常有两条出路

arXiv:2608.23962v1 Announce Type: new Abstract: 当 LLM serving 部署耗尽 KV cache 空间时,通常有两条出路。Tensor parallelism 将权重和 KV cache 分片到 2、4 或 8 个设备上,以每层的 all-reduce 和随设备数量增长的硬件成本为代价换取内存余量。算法社区则就地压缩 cache,通过 KV quantisation 和 eviction 在单张 GPU 上运行,以少量质量损失为代价。压缩论文报告内存压缩比,并行扩展论文报告吞吐曲线,几乎没有人将两者放在同一成本坐标轴上比较。我们将 tensor-parallel 配置(并行度 1 至 8)与 KV-compressed 配置(16/8/4-bit,keep-ratio 低至 0.25)置于同一成本归一化坐标轴——每百万 token 成本对延迟——使用基于 A100、A40 和 H100 硬件校准的 profiled simulator 进行测算,寻找成本等价交叉点。我们并未找到。跨越两个模型(Llama-2 7B 与 70B)、三种 GPU 类型以及我们所能构建的每一级内存缓解方案,压缩方案便宜 1.20x 至 2.00x。80 GB 设备上的 7B 模型无法在其自身 context window 内耗尽 KV 预算,而决定两种策略分界的因素是模型大小相对于设备内存的比例,80 GB 显卡约为 36B 参数。在该墙之下,压缩占主导,额外 GPU largely 是浪费支出;在其上,tensor parallelism 不再是可选项,而成为入场券:Llama-2-70B 在任何 KV 设置下单卡 A100 均不可行,因为瓶颈资源是权重,而 KV compression 不触及权重。Tensor parallelism 是唯一改善延迟的杠杆(压缩通过 batching contention 使 per-token 延迟恶化 8% 至 93%),而压缩是唯一倍增每美元容量的杠杆(16.5x,对比八倍 GPU 支出的 1.21x)。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明