返回资讯列表
Qwen3-4B 训练后三值化:有效位预算、存储压缩与部署

图源:arXiv cs.AI

Qwen3-4B 训练后三值化:有效位预算、存储压缩与部署

2026年9月3日作者:AI铺子编辑部
行业动态

01962v1 发布类型: 新稿 摘要:超低比特语言模型能够降低存储与内存带宽占用,但名义上的"1

arXiv:2609.01962v1 发布类型: 新稿

摘要:超低比特语言模型能够降低存储与内存带宽占用,但名义上的"1.58-bit"标签并不能完整描述其实际存储表示、保留能力或运行时行为。

本文研究 Qwen(一款经过指令微调的 40 亿参数模型)的端到端训练后转换,采用 KOTMS 旋转、E2M-ATQ 三值化以及来自 TWLA 的 GPTQ 风格误差补偿。本实验仅对权重进行量化:激活值保持 16-bit 精度,因此省略 ILA-AMP。我们评估了有效比特核算、任务能力保留度、perplexity、校准敏感性、checkpoint 构成以及部署行为。

最终转换对量化线性权重使用 1.641 有效比特/权重,81.62% 的模型参数被纳入量化目标。在十项可评分能力对比中,准确率从 64.5% 下降至 54.7%。性能退化并不均衡:BoolQ 保留了教师模型 84.6% 的 chance-corrected 表现,而 ARC-Challenge 仅保留 43.8%。WikiText-2 上的 perplexity 从 13.639 升至 18.748,PTB 上从 24.700 升至 31.992,C4 上从 19.831 升至 28.966。

后续一次 packing 运行保留了三值平面与缩放因子,将报告的模型大小从 8.29 GiB 压缩至 3.96 GiB,perplexity 基本不变。另有一次第三方 packing 尝试存在信息损失,未纳入主 artifact 声明。该打包后的 artifact 尚未进行端到端的任务准确率或生成吞吐量 benchmark。一项初步 Triton GEMV microbenchmark 在某一测试形状上比 FP16 cuBLAS 慢 4.6 倍。因此我们并不声称仅凭压缩就能实现更快的推理。

来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明