返回资讯列表
回答前:规模匹配记忆构建下的证据充分性

回答前:规模匹配记忆构建下的证据充分性

2026年9月30日作者:AI铺子编辑部
学术

研究团队发现多跳问答中证据不足样本的构造存在记忆规模泄露标签的捷径,并提出大小匹配方法加以消除。其设计的 MemSafe 估计器在 MuSiQue 和 HotpotQA 上分别取得 0.968 与 0.983 的 AUROC。

arXiv:2609.32269v1 公告类型:新发布 摘要:基于压缩记忆或检索记忆回答问题的 Agent,必须能够识别回答查询所需的证据已不在记忆中。该任务的 benchmark 通常通过删除支撑性段落来构造证据不足样本。我们发现,这种构造方式会通过记忆大小泄露标签:在 MuSiQue 上,一个仅统计段落数量的分类器,在检测不安全记忆时达到的 ROC 曲线下面积(AUROC)为 $0.979$,高于我们最初评估的词汇估计器。我们提出了一种大小匹配的构造方法,可在理论上消除这一捷径,并用它研究 MemSafe——该估计器将查询与每个记忆单元进行交叉编码,并用 set transformer 对各单元进行聚合。在三个多跳问答数据集和五个随机种子上,MemSafe 在 MuSiQue 和 HotpotQA 上分别达到 $0.968$ 和 $0.983$ 的 AUROC,比词汇基线高出 $0.26$ 到 $0.39$;而第三个数据集 2WikiMultiHopQA 已趋饱和。一个冻结的预训练交叉编码器加上 logistic 头,已经能弥合 MuSiQue 上词汇基线与 MemSafe 之间 $41\%$ 的差距。与此同时,在 MuSiQue 官方发布的不可回答问题集上,MemSafe 的退化程度超过了一个弱基线;在 SQuAD~2.0 上仅达到 $0.639$ 的 AUROC;并且在超过基于特征的估计器之前,还需要数千条临床训练样本。将其用作 7B 阅读器的门控时,在 $5\%$ 覆盖率下,它把已回答问题上的错误率从 $0.850$ 降至 $0.631$,优于阅读器置信度,平均而言也优于 ground-truth 完整性标签;不过在 $10\%$ 覆盖率下,7B LLM 裁判是更好的门控。这些结果表明,证据不足样本的构造方式,与检测证据不足的估计器本身同样重要。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。