返回资讯列表
ChainDoRA:基于张量列车分解的 LLM 高效参数微调新方法

ChainDoRA:基于张量列车分解的 LLM 高效参数微调新方法

2026年9月23日作者:AI铺子编辑部
大模型

arXiv:2609.25058v1 公告类型:新发布 摘要:参数高效微调(PEFT)在仅更新少量预训练参数的情况下,使大语言模型(LLM)适配下游任务。低秩适配(LoRA)使用两个可训练的低秩矩阵,而权重分解低秩适配(DoRA)进一步分。

arXiv:2609.25058v1 公告类型:新发布 摘要:参数高效微调(PEFT)在仅更新少量预训练参数的情况下,使大语言模型(LLM)适配下游任务。低秩适配(LoRA)使用两个可训练的低秩矩阵,而权重分解低秩适配(DoRA)进一步分离权重幅度与方向,但其方向分支仍保留稠密的 LoRA 式分解。我们提出 ChainDoRA,一种权重分解适配框架,通过一条连通的 Tensor-Train(TT)链构建方向低秩因子;其中 adapter 的秩充当输入侧与输出侧 TT 收缩之间的边界秩,而独立的 TT 秩则控制表示容量与参数开销。在受控的 15,119 条仅响应适配设置下,我们以 LLaMA-7B 为模型,在七个常识推理 benchmark 上将 ChainDoRA 与对等的 LoRA 和 DoRA 基线进行评估。TT 秩为 16 的 ChainDoRA 在七项任务上的平均准确率达到 72.30%,而 LoRA 为 69.88%,DoRA 为 69.39%;其可训练参数仅为 5.35M,相比之下 LoRA 为 56.10M,DoRA 为 56.98M,相当于相对 DoRA 减少了 90.62% 的参数。关于 TT 秩和 adapter 放置位置的消融实验表明,参数与准确率之间的权衡是可控的;这说明连通的 TT 参数化能够显著降低幅度-方向适配的参数开销,同时在该设置下保持甚至提升下游推理性能。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明