返回资讯列表

LLM 微调是否必须依赖人类可读文本?
2026年9月30日作者:AI铺子编辑部
大模型学术
研究团队提出名为DASA的大模型微调新方法,利用冻结参考模型的激活梯度反馈优化连续合成嵌入,不再依赖人类可读文本。实验覆盖Llama与Qwen系列共六个模型及六个基准测试,结果显示其性能与源自然语言数据相当,部分配置下表现更优。
arXiv:2609.35868v1 公告类型:new
摘要:人类可读性对于大语言模型的有效微调是否必不可少?我们研究了以模型为条件的训练表示能否在无需人类可读文本形式的情况下,保留或提升自适应效用。我们提出期望更新对齐合成数据(Desired-Update-Aligned Synthetic Data, DASA),该方法利用冻结参考模型的激活梯度反馈来引导连续合成输入嵌入的优化。受激活梯度在局部风险降低中所起作用的启发,DASA 瞄准的是有用的自适应更新,而非源文本重建或语言流畅性。所得嵌入被直接用于下游微调;离散 token 投影仅用于定性检查。实验涵盖 Llama 和 Qwen 两个系列的六个模型(参数量从 1B 到 32B),涉及六个 benchmark,覆盖知识、数学推理、代码生成和常识推理。在匹配的 LoRA 自适应设置下,DASA 取得了与源自然语言数据相当的性能,并在多种配置下超越源数据,同时在多数对比中优于 GRADMM。进一步的实验覆盖了通用领域和任务专门化的源数据。在所评估的合成设置下,DASA 相比 GRADMM 实现了 $3.6$--$4.9\times$ 的加速,且峰值 GPU 显存占用相当。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。