返回资讯列表
面向节能部署的LLM推理感知压缩:识别并保护关键推理电路

图源:arXiv cs.AI

面向节能部署的LLM推理感知压缩:识别并保护关键推理电路

2026年9月9日作者:AI铺子编辑部
大模型

05512v1 公告类型:新发布 摘要:大型推理模型(LRM)在部署过程中会产生可观的能耗,然而当前的压缩方法对所有组件施加统一量化,可能损害关键的推理回路

arXiv:2609.05512v1 公告类型:新发布 摘要:大型推理模型(LRM)在部署过程中会产生可观的能耗,然而当前的压缩方法对所有组件施加统一量化,可能损害关键的推理回路。我们提出一种推理感知的压缩框架,在五个推理 benchmark(GSM8K、FOLIO、MATH-500、ProofWriter 和 MuSiQue)上对量化条件进行 benchmark 测试,并进行硬件级别的 GPU 能耗测量;通过在留出校准集上进行扰动扫描,对全部 196-224 个(层,投影)对逐一分析 INT4 量化脆弱性,随后选择性地将最敏感的回路恢复为 FP16。我们得出三点发现。第一,INT4 量化可能通过延长推理链反而增加能耗;在 GSM8K 上,25% 的功耗降低最终演变为净能耗增加。第二,脆弱性具有任务依赖性:注意力投影对数学推理更为关键,而在逻辑推理中,不同架构的敏感度模式存在差异。第三,选择性压缩能够达到统一量化方法无法企及的 Pareto 最优点:R1-Qwen-7B 在 ProofWriter 上取 Top-10% 时,相比 FP16 提升 +12 pp,同时能耗降低 -9.7%,并在五个推理 benchmark 的留出数据上得到验证。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明