返回资讯列表
知识图谱门控反事实化:实现Agent对话AI的风格可控与事实保留生成

知识图谱门控反事实化:实现Agent对话AI的风格可控与事实保留生成

2026年8月24日作者:AI铺子编辑部
行业动态

20393v1 发布类型:新论文 摘要:部署于客服等对事实敏感场景的 Agentic 大语言模型(LLM)必须同时保证事实正确性,并以可控的风格语域生成回复

arXiv:2608.20393v1 发布类型:新论文

摘要:部署于客服等对事实敏感场景的 Agentic 大语言模型(LLM)必须同时保证事实正确性,并以可控的风格语域生成回复。Activation steering 通过对隐藏表示进行扰动来实现免微调的风格控制,但其缺乏区分可验证事实与风格内容的显式机制,导致语义泄漏(semantic leakage)。我们通过Defactualize-Steer-Rehydrate(DSR)应对这一挑战,这是一个知识工程框架,将带类型的显著性加权知识图谱(KG)与 activation steering 相结合。DSR 使用分层正则表达式、NER 或词汇分类器流水线提取显著实体,在 steering 之前将其替换为带类型的占位符,并在生成后通过显著性引导的 rehydration 确定性地恢复已验证的值。DSR 在六个 LLaMA 系列模型(1B–13B 参数)上进行了评估,基于 600 个 A2A 生成的客服案例(1,200 次生成),并包含专门的 KG 消融实验。DSR 相对于仅 steering 的基线显著提升了已验证实体的恢复率(Cohen's $d=0.225$,$p_{\text{Bonf}}=1.0\times10^{-4}$),尽管绝对恢复率仍有提升空间,同时在不同模型家族中保持了有效的风格控制。逐层可分离性与 steering 强度诊断进一步揭示了表示层 steering 与事实 grounding 之间此前未被探索的交互关系。这些结果表明,显式的知识工程能够系统性地增强可信、可控且可复现的生成式 AI,而无需模型微调。代码、缓存的 steering 向量及评估脚本均已公开发布以支持可复现性。https://github.com/Tanmay-IITDSAI/KG-Gated-Defactualization

来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明