返回资讯列表
从装饰到承重:任务难度决定思维链的因果作用

从装饰到承重:任务难度决定思维链的因果作用

2026年9月23日作者:AI铺子编辑部
行业动态

arXiv:2609.25366v1 公告类型:新发布 摘要:思维链(CoT)监控只有在书面推理对答案形成因果约束时才有意义。我们提出基于续写的因果测试,这是一种消融-补丁干预方法:扰动单个推理步骤、截断思维链,并强制模型从被破坏的前缀继。

arXiv:2609.25366v1 公告类型:新发布 摘要:思维链(CoT)监控只有在书面推理对答案形成因果约束时才有意义。我们提出基于续写的因果测试,这是一种消融-补丁干预方法:扰动单个推理步骤、截断思维链,并强制模型从被破坏的前缀继续生成。该方法衡量 CoT 对最终答案的“承重性”(load-bearingness),这是一种有别于机制忠实性(mechanistic faithfulness)的行为层面的概念。在 GSM8K、MMLU 和 BIG-Bench Hard 上,对 Gemma-2-9B-IT、Llama-3.1-8B-Instruct 和 DeepSeek-R1-Distill-Qwen-7B 的实验表明,CoT 的承重性随模型相对任务难度变化:在简单任务上,模型会静默绕开自身推理;在困难任务上,模型会跟随被破坏的步骤并传播错误。一项匹配的 2x2 分析显示,任务难度主导了扰动类型的影响:从 GSM8K 到 BBH 多步算术,错误传播上升了 16 倍;对 28,584 条续写结果的方差分解表明,在已解释方差中,98.8% 归因于任务难度,仅 0.8% 归因于扰动类型。针对推理的强化学习(RL)会抑制错误传播,并压缩这一梯度。通过四种变体的评判敏感性分析和双标注者盲评研究(n=500),我们发现“错误传播”与“非错误传播”的标签对评判提示具有不变性,标注者间一致性达到完美(Cohen's kappa = 1.00)。这一梯度给基于 CoT 的监督与 AI 安全监控带来结构性难题:在轨迹易于阅读之处,其携带的信号很弱;在监控真正重要之处,错误往往在监控者介入前就已传播。对隐状态的线性探针可以区分静默绕开、自我纠正和错误传播三种模式,但加性激活引导(additive activation steering)提供的因果控制有限,最多只能翻转约 25% 的错误传播案例。行为模式可读,但尚无法被可靠控制。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明