返回资讯列表
ChainDoRA:基于张量列车分解的 LLM 参数高效微调方法

ChainDoRA:基于张量列车分解的 LLM 参数高效微调方法

2026年9月23日作者:AI铺子编辑部
大模型

arXiv:2609.25058v1 公告类型:新发布 摘要:参数高效微调(PEFT)在仅更新大型语言模型(LLM)少量预训练参数的情况下,使其适配下游任务。低秩适配(LoRA)使用两个可训练的低秩矩阵,而权重分解低秩适配(DoRA)进一。

arXiv:2609.25058v1 公告类型:新发布 摘要:参数高效微调(PEFT)在仅更新大型语言模型(LLM)少量预训练参数的情况下,使其适配下游任务。低秩适配(LoRA)使用两个可训练的低秩矩阵,而权重分解低秩适配(DoRA)进一步将权重幅值与方向分离,但在其方向分支中仍保留稠密的 LoRA 式分解。我们提出 ChainDoRA,一种权重分解适配框架,它通过连接的 Tensor-Train(TT)链构建方向低秩因子,其中 adapter 秩构成输入侧与输出侧 TT 收缩之间的边界秩,而独立的 TT 秩控制表示能力与参数开销。在基于 LLaMA-7B 的受控 15,119 条仅响应式适配设置下,ChainDoRA 在七个常识推理 benchmark 上与对等的 LoRA 和 DoRA 基线进行了评估。TT 秩为 16 的 ChainDoRA 在七个任务上的平均准确率达到 72.30%,而 LoRA 为 69.88%,DoRA 为 69.39%;其可训练参数仅需 5.35M,相比之下 LoRA 为 56.10M,DoRA 为 56.98M,相当于相对 DoRA 减少了 90.62%。关于 TT 秩与 adapter 放置位置的消融实验显示了可控的参数-准确率权衡,表明连接的 TT 参数化能够显著降低幅值-方向适配的参数开销,同时在该设置下保持并提升下游推理性能。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。