返回资讯列表
MoE 路由器"可缓存化"设计遇阻:针对边缘内存带宽墙的局部性优化预注册研究呈阴性结果
2026年8月21日作者:AI铺子编辑部
学术
18261v1 公告类型: new 摘要: 在单张 8 GB GPU 上 serving 一个 235B 参数的 Mixture-of-Experts (MoE) 模型,瓶颈并非算力,而是内存带宽:decode 阶段必须从存储各 token 活跃专家的层级流式传输数据,而在消费级硬件上,大多数...
arXiv:2608.18261v1 公告类型: new
摘要: 在单张 8 GB GPU 上 serving 一个 235B 参数的 Mixture-of-Experts (MoE) 模型,瓶颈并非算力,而是内存带宽:decode 阶段必须从存储各 token 活跃专家的层级流式传输数据,而在消费级硬件上,大多数专家位于比 RAM 慢得多的 SSD 上。我们在 Qwen3-235B (Q4_K_M, 134 GB) 上量化这一带宽墙:实测 warm 状态 decode 为 0.44 tok/s,与 bytes-per-token / bandwidth 模型吻合;而一个本应摊销单次磁盘扫描的 batching 方案,却在 batch 32 时因 paging thrash 而崩溃。我们构建了 llama-moe-trace,一款零侵入的路由遥测工具,并在 Qwen3-30B 上测量路由特性:相邻 token 的专家复用概率为 2.0 倍,95% 的流量使用 52.5% 的专家,而 13.4% 专家的 LRU cache 即可服务 66% 的请求。随后我们探究 cacheability 是否可训练:我们预注册了 137M MoE 语言模型的训练,采用辅助 locality loss 和 domain router loss,以 cache-miss 降低与 perplexity 的联合标准作为评判。该机制有效(miss 最高降低 60%;99% static-pin 命中率),但所有配置均未通过预注册的 perplexity <=1% 门槛——miss 降低与质量紧密耦合。同期工作 StickyMoE 报告称在单域 sub-25M 模型上该 loss 近乎无代价;在多域 137M 模型上我们发现代价真实存在。我们的贡献在于这一预注册的、更严格标准的、多域评估,以及边缘 serving 的实测。340M 规模的实验表明该代价不随规模缩小(反而略有上升)。我们进一步证明无训练的 cache-aware rerouting 可与训练得到的 locality 叠加——两者结合在两种规模下实现约 80% miss 降低且 perplexity <=3.4%,远比单独使用任一方案廉价——而 domain-primed prefetching 并无帮助。所有代码、trace 及预注册文件均已发布。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。