返回资讯列表
可信 AI 的基石:以工程化立场表达怀疑、溯源与信念修正

可信 AI 的基石:以工程化立场表达怀疑、溯源与信念修正

2026年9月23日作者:AI铺子编辑部
行业动态

arXiv:2609.26035v1 公告类型:新提交 摘要:对话 Agent 在给出回答时往往采用清一色的自信语气。我们测试了能否将"表达不确定性""基于来源的断言"以及"显式信念修正"作为行为层叠加在固定语言模型之上;本研究不测试可信。

arXiv:2609.26035v1 公告类型:新提交 摘要:对话 Agent 在给出回答时往往采用清一色的自信语气。我们测试了能否将"表达不确定性""基于来源的断言"以及"显式信念修正"作为行为层叠加在固定语言模型之上;本研究不测试可信度或信任度。该行为层包含三种认知状态、逐条断言的置信度与类型化来源标注、一条以来源为门控条件的表达规则,以及一个持久化的修正存储区,支持可审计的确认回执,并对错误修正具有一定抵抗力。我们在一个构造的、可机械评分的多轮基准上,使用合成模型与 Qwen2.5-0.5B-Instruct 进行评估。合成测试工具通过了全部五项检查。在真实模型上,确认回执的可靠性(一项构造性保证)在 100% 的案例中成立;真实修正的接受率高于错误修正(对已持有信念分别为 0.44 与 0.15;若计入规则所接受的对未持有事实的修正,则分别为 0.875 与 0.420)。但预先设定的表达保真度、矛盾分离度和来源余量三项指标均未达标。一项披露的事后分析显示,以答案 token 平均概率为门控条件的表达方式,其正确性排序低于随机水平(按对话聚类的 AUC 为 0.41);而以采样一致性为门控条件则具有区分能力(AUC 为 0.66)。基于该发现选出的以一致性为门控条件的配置,在一份单独提交的协议下评估,达到了对话层面的操纵标准与能力等价标准,并在重新抽取的对话集上得到复现。该操纵结果依赖于具体选择;当不确定性按 60 个事实聚类时,两项标准仍未解决。目前得到支持的结论仅限于:构造性审计保证、依赖存储区的部分修正判别能力,以及 token 概率门控在特定基准与特定模型上的失效;在开展人工评估之前,还需扩大事实库规模。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明