返回资讯列表

UniEvo-VL:多模态模型自我进化的在策略自蒸馏训练方案
2026年10月1日作者:AI铺子编辑部
大模型学术产品
研究团队推出多模态模型自进化框架UniEvo-VL,利用自我批评作为特权信息实现教师学生一体化训练。该方法无需外部教师模型,在测试时计算中通过自蒸馏提升图像生成能力;基于Qwen-image-2512构建。
arXiv:2609.38721v1 公告类型:新发布
摘要:现代多模态模型将生成与理解整合进单一统一系统,使其能够提供并学习自身反馈。基于这一统一能力,我们提出 UniEvo-VL——一个自进化框架,使多模态模型能够在测试时计算(test-time compute)过程中从这种建设性的自我修正反馈中学习。我们不依赖单独的、通常规模更大的教师模型,而是将模型的自我批评(self-critiques)作为特权信息(privileged information),让单一多模态模型在不同上下文下同时扮演教师与学生角色:学生仅看到原始问题,而教师则以特权批评为条件。随后,训练过程在学生自身的采样轨迹上,最小化二者去噪扩散分布(denoising diffusion distributions)在各状态上的散度。实验表明,UniEvo-VL 在提升多模态模型图像生成能力的同时,保持了其对额外反思信息的敏感性。具体而言,我们在开源模型 Qwen-image-2512 之上进行构建,在 GenEval 上观察到性能从 0.747 显著提升至 0.808,在 GenEval2 Soft-TIFA 上从 32.97 提升至 35.53。此外,使用更强大的外部批评模型(如 GPT5.6-Luna)的尝试表明,具备强评判能力的多模态模型有望达到更高的自进化上限。最后同样重要的是,混合文本渲染(mixed text-rendering)结果显示,我们的自我改进在不同任务间可能并不均衡。本研究旨在为当前热门的递归自我改进(recursive self-improvement)研究方向提供启发,在无需外部监督或指导的情况下,增强用户使用多模态模型时的体验。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。