返回资讯列表
韩语27B模型响应风格对齐的脱靶效应

韩语27B模型响应风格对齐的脱靶效应

2026年9月12日作者:AI铺子编辑部
大模型

11291v1 公告类型:new 摘要:我们对 Qwen3

arXiv:2609.11291v1 公告类型:new 摘要:我们对 Qwen3.8-27B 进行后训练,以适配韩语回复风格——包括详略程度、列表与 markdown 的使用、语篇结构和语域——并测量了两个训练目标从未针对的行为:一是在 KoBBQ 中对模糊社会问题的 abstention(基准正确答案为 UNKNOWN),二是在证券指引中的 unprompted disclosure(主动披露)。两者都发生了变化,且这些变化主要通过模型的 emission policy(输出策略)体现:即它回答的频率以及说多少内容。 匹配的目标形式对照实验表明,回答倾向取决于训练目标,而非仅靠提示集或训练配方。在固定提示、配方、数据规模和服务配置、仅改变目标文本的条件下,三个风格种子给出正向的回答率点估计(均值 +0.82 pp),三个中性种子给出负向估计(均值 -1.53 pp);观测到的种子范围互不重叠,均值相差 2.34 pp。一个长度匹配的实验组位于两者之间,而第四个保持简短但保留对冲措辞的实验组在不同种子间表现不稳定,因此究竟是形式的哪个特征起作用尚未解决。 对于绝对的刻板印象暴露,将其分解为回答倾向项和条件构成项只是代数恒等式,而非研究发现;其实证意义在于变化的去向。在各训练检查点中,变化主要由回答倾向主导,而构成项保持较小,且由于该项是在依赖处理状态的已回答子集上评估的,我们不将其解读为关于潜在偏好的证据。 由此得出两个测量结果。当回答状态依赖于处理时,条件刻板印象份额的组间对比无法识别条件内容偏好的变化。此外,同一构念的两个规则检测器之间的一致性从 0.44 到 0.99 不等,取决于文本由哪个检查点生成——这一观察无需任何参考标签即可获得。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明