返回资讯列表
Pistis 技术报告

Pistis 技术报告

2026年9月25日作者:AI铺子编辑部
大模型

Pistis 模型家族基于 Qwen3.6 与 Qwen3.5 构建,涵盖 27B 和 9B 两种参数规模的多模态大语言模型。其核心创新在于交错蒸馏与强化学习(IDRL)后训练范式,在单一训练回路中交替优化两个目标。

arXiv:2609.28554v1 公告类型:new 摘要:我们推出 Pistis 模型家族,包含基于 Qwen3.6 和 Qwen3.5 构建的 27B 和 9B 参数多模态大语言模型,二者均通过一套通用且可扩展的后训练框架开发而成。该框架首先通过大规模多模态监督微调(SFT)奠定坚实基础。在此 SFT 基础之上,我们提出交错蒸馏与强化学习(Interleaved Distillation and Reinforcement Learning, IDRL),这是一种全新的后训练范式,在单一训练回路中紧密整合 on-policy 蒸馏与强化学习。IDRL 通过在两个目标之间交替优化,而非孤立优化其中任一目标或以静态联合损失简单结合二者,实现了更有效的知识迁移、更高的优化稳定性,以及针对长周期 agentic 轨迹的更精确信用分配,从而在缓解常见能力权衡的同时带来更强的性能表现。在两个模型规模上,该框架均产出两个专用变体:Pistis-Thinking 旨在强化深度多模态推理能力;Pistis-Agentic 则额外引入 agentic 轨迹数据,以支持长周期规划、迭代推理和工具调用。Pistis-Agentic 在多模态搜索方面表现尤为突出。两个规模的模型均超越了对应的基础模型。在模型参数优化之外,我们进一步提出 Pistis-Auto-Harnessing(PAH),一种系统级方法,通过迭代优化自动改进 agent 的推理 harness。实验表明,PAH 无需更新模型参数或增加交互预算,即可提升模型性能。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。