返回资讯列表
临床LLM多步Agent的反事实公平性审计需设定逐动作不稳定性下限

图源:arXiv cs.CL

临床LLM多步Agent的反事实公平性审计需设定逐动作不稳定性下限

2026年9月4日作者:AI铺子编辑部
大模型

03221v1 公告类型:new 摘要 反事实审计(Counterfactual audit)是检验临床 Agent 是否对人口统计学特征不同但临床状况相同的患者采取差异化对待的标准工具

arXiv:2609.03221v1 公告类型:new

摘要

反事实审计(Counterfactual audit)是检验临床 Agent 是否对人口统计学特征不同但临床状况相同的患者采取差异化对待的标准工具。其输出为翻转率(flip rate):即仅当患者描述符改变时,Agent 行为发生变化的频率。我们表明,该指标单独来看是不可解释的。在 16 个临床情景(vignette)中,对完全相同的条件重复运行 10 次(相同叙事、相同描述符字符串、无任何变化),临床 Agent 的行为在 8.7% 的结果-情景单元中发生了变化,且不稳定性在不同行为间异质性显著,相差达 8 倍——从 ICU 升级的 0.022 到管制药品警示的 0.179。我们数据中的任何人口统计学对比都无法与这一基线(floor)区分开来。第二个模型给出的汇总基线为 6.7%,且对六种行为的排序几乎完全一致(Spearman 相关系数 0.94,精确 p 值=0.017),因此该基线并非单一系统的产物。对五次采样进行多数投票聚合可消除 39% 的不稳定性,但此后趋于平缓;零假设模拟将剩余部分归因于异质的单元级比率,故重复实验可缓解但无法消除。因此,任何未附带各行为基线的反事实公平性估计都不能被解读为差异证据。

上述测量通过 FairMedAgent 完成,这是一个用于评估临床 LLM Agent 行为差异的评测框架,其估计量为"范围内反事实翻转率"(within-range counterfactual flip rate),仅统计已发表决策规则允许且经临床医师裁定的行为之间的翻转。该估计量需要带状裁定(band adjudication),目前正在进行中;本文不主张任何差异结果。每个合成情景在固定形式条件下运行六阶段轨迹(围绕确定性环境步骤的五个模型面向决策),涵盖种族、性别、年龄、保险、英语熟练度及其交叉维度。该框架、基线协议及全部分析脚本均已开源。

来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明