返回资讯列表
ChainDoRA:基于张量列车分解的 LLM 高效微调方法

ChainDoRA:基于张量列车分解的 LLM 高效微调方法

2026年9月23日作者:AI铺子编辑部
大模型

ChainDoRA是一种面向大型语言模型的高效微调框架,用相连的张量列车链重构方向低秩因子。它在七项常识推理任务上平均准确率达72.30%,高于LoRA与DoRA;可训练参数仅5.35M,较DoRA减少90.62%。

arXiv:2609.25058v1 公告类型:new 摘要:参数高效微调(PEFT)在仅更新大型语言模型(LLM)少量预训练参数的情况下,使其适配下游任务。低秩适配(LoRA)使用两个可训练的低秩矩阵,而权重分解低秩适配(DoRA)进一步将权重幅值与方向分离,但其方向分支仍保留密集的 LoRA 式分解。我们提出 ChainDoRA,一种权重分解适配框架,它通过一条相连的 Tensor-Train(TT)链来构造方向低秩因子,其中 adapter 的秩充当输入侧与输出侧 TT 收缩之间的边界秩,而一个独立的 TT 秩控制表示能力与参数开销。在受控的 15,119 条仅响应适配设置下,使用 LLaMA-7B 在七个常识推理 benchmark 上对比了参数规模匹配的 LoRA 与 DoRA 基线。TT 秩为 16 的 ChainDoRA 在七项任务上的平均准确率达到 72.30%,而 LoRA 为 69.88%,DoRA 为 69.39%;同时仅需 5.35M 可训练参数,相比之下 LoRA 为 56.10M,DoRA 为 56.98M,相当于较 DoRA 减少 90.62%。关于 TT 秩与 adapter 放置位置的消融实验显示了可控的参数-准确率权衡,表明相连的 TT 参数化能够大幅降低幅值-方向适配的参数开销,同时在该设置下保持甚至提升下游推理性能。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明