返回资讯列表

LatentPort:跨模型迁移循环记忆,4B到9B混合状态免前缀重放交接
2026年9月23日作者:AI铺子编辑部
大模型
arXiv:2609.25053v1 公告类型:新发布 摘要:一个语言模型能否将自己的实时记忆交给另一个模型,而无需接收方重新读取上下文?我们在一对架构匹配的 Qwen。
arXiv:2609.25053v1 公告类型:新发布
摘要:一个语言模型能否将自己的实时记忆交给另一个模型,而无需接收方重新读取上下文?我们在一对架构匹配的 Qwen3.5 4B 到 9B 兄弟模型之间,实现了可用的持久化混合状态迁移。据我们所知,这是首次在规模不同的混合语言模型之间,无需目标端前缀回放即可实现持久化循环推理状态的跨模型交接。仅迁移注意力 KV 仍存在较大差距;加入 Gated DeltaNet(GDN)持久状态包后,教师强制负对数似然(NLL,即平均下一 token 对数损失)降低了 0.747 nats/token(95% 配对文档 bootstrap 置信区间 [0.6921, 0.8047]),并在全部 64 篇 PG19 文档上均有改善。直接复用循环状态与卷积状态优于所测试的基于学习的 GDN 映射,这与持久状态坐标存在部分功能兼容性一致。一项全新的组件因子化实验选择了“迁移 KV + 直接复用循环状态与卷积状态”的组合。一个额外的 434,176 参数校正模块在 64 篇全新网络文档上对该基座进行了改进:续写损失比原生 9B 高 0.076 nats/token(excess NLL),Jensen-Shannon(JS)散度为 0.022,原生上下文恢复率(NCR)为 0.918。校正后的 9B 在处理零个历史前缀 token 的情况下,显著优于继续运行 4B 推理。证据覆盖单一方向、一对几何匹配的 Base 模型,以及 4K 教师强制续写;近原生门控(near-native gate)未能通过,16K 分支未运行,自由生成等价性与通用状态接口仍未得到证明。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。