返回资讯列表
ChainDoRA:基于张量列车分解的权重分解低秩适配,实现参数高效 LLM 微调

ChainDoRA:基于张量列车分解的权重分解低秩适配,实现参数高效 LLM 微调

2026年9月23日作者:AI铺子编辑部
大模型学术

研究团队提出ChainDoRA框架,用张量列车分解改造权重分解适配。其方向低秩因子由连通的TT链构建,适配器秩作为边界秩,独立TT秩控制容量与开销;在LLaMA-7B七个常识推理任务上,平均准确率72.30%,优于LoRA与DoRA。

参数高效微调(PEFT)仅更新大语言模型(LLM)中一小部分预训练参数,即可将其适配到下游任务。低秩适配(LoRA)使用两个可训练的低秩矩阵,而权重分解低秩适配(DoRA)进一步分离了权重的幅度与方向,但其方向分支仍保留稠密的 LoRA 式分解结构。我们提出 ChainDoRA,一种权重分解适配框架,其方向低秩因子由一条连通的 Tensor-Train(TT)链构建:适配器秩构成输入侧与输出侧 TT 收缩之间的边界秩,而一个独立的 TT 秩则控制表示容量与参数开销。在基于 LLaMA-7B 的受控“仅回复”适配设置中(15,119 条样本),ChainDoRA 在七个常识推理 benchmark 上与对等的 LoRA 和 DoRA 基线进行了对比评估。TT 秩为 16 的 ChainDoRA 取得七任务平均准确率 72.30%,高于 LoRA 的 69.88% 和 DoRA 的 69.39%;同时仅需 5.35M 可训练参数,而 LoRA 和 DoRA 分别需要 56.10M 和 56.98M,相对 DoRA 减少了 90.62%。针对 TT 秩与适配器放置位置的消融实验表明,参数—准确率之间的权衡是可控的,说明连通的 TT 参数化能够大幅降低幅度—方向适配的参数开销,同时保持——并在该设置下提升——下游推理性能。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明