返回资讯列表
患者突然插话时:临床对话式AI安全如何覆盖打断场景

图源:arXiv cs.CL

患者突然插话时:临床对话式AI安全如何覆盖打断场景

2026年9月1日作者:AI铺子编辑部
行业动态

29241v1 Announce Type: new Abstract: 临床语音助手现已部署于常规护理场景中,而真实患者并不会排队等候发言:他们会打断

arXiv:2608.29241v1 Announce Type: new Abstract: 临床语音助手现已部署于常规护理场景中,而真实患者并不会排队等候发言:他们会打断。这些系统通常采用级联架构(语音转文本 -> LLM -> 文本转语音),因此当患者在助手发言中途打断时,即使模型能够很好地处理合作式对话记录,临床所需的内容也可能丢失。然而,临床对话式 AI benchmark 几乎普遍假设患者会等待助手说完,从而忽略了打断导致的关键内容丢失问题。我们提出了一种基于对话记录的打断恢复评估方法,将会话分析中的重叠类别改编为三种可操作类型(识别性、竞争性、过渡性子单元),并在四个测试单元中测试了四种面向部署的非推理 LLM 配置,涵盖病史采集(信息收集)和 FAQ(信息提供)场景,评分标准为助手是否保留了临床所需内容。在采集单元中,目标问题失败率因模型而异;在提供单元中,各模型可直接对比,所有模型的失败率均有所上升。不同单元中的排名存在差异,且在竞争性 FAQ 打断场景下,四个模型均出现 30/30 的提供覆盖失败(Wilson 95% CI: 88.6-100.0%;基线方面,三个模型为 0/30,Llama 为 4/30)。一个简短的道歉标记("sorry to interrupt")会使恢复率变化数十个百分点,且在不同模型间表现不一致,甚至对其中一个模型会降低恢复率。因此,打断鲁棒性不能用一个单一分数来衡量:评估必须基于内容、按单元分别报告,并与部署场景的打断特征相匹配。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明