返回资讯列表
思考能否促进公平?推理token消除部分偏见却滋生更多

思考能否促进公平?推理token消除部分偏见却滋生更多

2026年9月28日作者:AI铺子编辑部
大模型学术

一项新研究在三个推理语言模型上开展消融实验,考察思考机制对反事实公平性的影响。结果显示思考既能消除部分既有偏见翻转,又会滋生约五倍数量的新翻转。偏见随思考深度传播并被放大,其根源在于样本对状态的联合转移。

arXiv:2609.30768v1 公告类型:新发布 摘要:关于推理语言模型(RLM)中的"思考"(thinking)机制究竟能消解还是放大偏见,学界一直存在争议。此前研究得出了两个方向相互矛盾的结论。我们通过在同一模型内进行"思考 vs. 不思考"的消融实验,在 QwQ-32B、DeepSeek-R1-Distill-Qwen-32B 和 Qwen3-32B 三个模型上,针对 Adult、COMPAS、Credit 三个高风险决策任务,发现"思考"对反事实公平性(counterfactual fairness)具有不对称的双重效应:它既能消解不思考基线产生的反事实翻转(counterfactual flips),又会在模型置信度接近饱和时产生新的翻转。在全部九个(模型,数据集)组合中,新产生的翻转数量约为被消解翻转数量的 5 倍。为解释这一效应,我们将思考轨迹(thinking trace)本身视为公平性变化的可测量载体,并通过两种动态工具进行研究:1)提出反事实深度概率差(Counterfactual Depth Probability Gap, CDPG),用于追踪偏见随思考深度的演化,观察到偏见会随思考过程传播并放大。2)构建偏见转移矩阵(Bias Transition Matrix, BTM),刻画反事实样本对的预测如何从不思考状态转变为思考状态,并发现这种不对称双重效应源于样本对状态的联合转移。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。