返回资讯列表

可信 AI 的基石:可表达的怀疑、溯源与信念修正
2026年9月23日作者:AI铺子编辑部
行业动态
arXiv:2609.26035v1 公告类型:新提交 摘要:对话 Agent 在表达答案时往往采用清一色的自信语气。我们测试了能否将"表达不确定性""基于来源的断言"以及"显式信念修正"作为行为层叠加在固定语言模型之上;我们并不测试可信。
arXiv:2609.26035v1 公告类型:新提交
摘要:对话 Agent 在表达答案时往往采用清一色的自信语气。我们测试了能否将"表达不确定性""基于来源的断言"以及"显式信念修正"作为行为层叠加在固定语言模型之上;我们并不测试可信度或信任度。该行为层包含三种认知状态、逐条断言的置信度与类型化来源标注、一条由来源门控的表达规则,以及一个带可审计确认记录、并对错误修正具有部分抵抗力的持久化修正存储。我们在一个构造的、可机械评分的多轮会话 benchmark 上,使用合成模型和 Qwen2.5-0.5B-Instruct 对其进行评估。合成测试工具通过了全部五项检查。在真实模型上,确认合理性(一项由构造保证的性质)在 100% 的案例中成立;真实修正被接受的比例高于虚假修正(对已持有信念为 0.44 对 0.15;若计入对未持有事实按规则接受的修正,则为 0.875 对 0.420)。但预先设定的表达保真度、矛盾分离度和来源余量三项指标均未达标。一项已披露的事后分析显示,基于答案 token 平均概率进行门控的表达,其正确性排序从头到尾低于随机水平(按会话聚类的 AUC 为 0.41);而基于采样一致性的门控则具有区分能力(AUC 0.66)。由该发现选出、并在单独承诺的评估方案下测试的一种一致性门控配置,达到了会话层面的操纵标准与能力等价标准,并在重新抽取的会话集上复现了这一结果。该操纵结果依赖于选择过程;当不确定性以 60 条事实为单位聚类时,两项标准仍未解决。目前得到支持的结论仅限于:由构造保证的审计性质、依赖存储的部分修正区分能力,以及 token 概率门控在特定 benchmark 和模型上的失效;在开展人工评估之前,必须先扩展事实库的规模。
来源:arXiv cs.CL | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。