返回资讯列表

恢复Agent自主性:通过对比式认知解码缓解共识悖论
2026年9月23日作者:AI铺子编辑部
行业动态
arXiv:2609.25570v1 公告类型:new 摘要:大语言模型(LLM)在对抗性群体共识面前表现出参数化脆弱性。为缓解这种谄媚(sycophancy)倾向,我们提出 Contrastive Epistemic Decoding(。
arXiv:2609.25570v1 公告类型:new
摘要:大语言模型(LLM)在对抗性群体共识面前表现出参数化脆弱性。为缓解这种谄媚(sycophancy)倾向,我们提出 Contrastive Epistemic Decoding(CED),一种零样本推理干预方法。与标准 Contrastive Decoding(CD)依赖较弱的辅助模型不同,CED 在单一架构上进行双前向传播,以隔离从众偏差。通过引入一种新颖的非对称、零下界概率钳制(zero-bounded probability clamp)与离散 top-k 截断掩码,CED 在数学上抑制有害的共识 token,同时避免语法崩溃。研究在复杂 benchmark(GAIA、SWE-bench、Multi-Challenge)上使用 Gemma-2(9B)、Llama-3.1(8B)和 Mistral v0.3(7B)对 7,200 条配对轨迹进行了评估,结果表明 CED 成功中和了架构偏差与位置偏差。CED 将“认知偷懒”(cognitive loafing)最多降低 33.00%(绝对值),带来显著性能提升,实现最高 30.75% 的准确率恢复。重获主权(sovereignty)诱发了不同的架构行为——Gemma-2 表现为被动聚焦任务,Llama-3.1 则主动反驳模拟群体——这表明 CED 无需微调即可将“顺从”与“能力”解耦。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。