当词汇理解失效临床推理:评估治疗机器人对Alpha世代的安全风险
20345v1 Announce Type: new Abstract: 对话式 AI 系统已成为 Alpha 世代(Gen Alpha,出生于 2010-2024 年)非正式的心理健康支持资源,美国有 13
对话式 AI 系统已成为 Alpha 世代(Gen Alpha,出生于 2010-2024 年)非正式的心理健康支持资源,美国有 13.1% 的青少年(540 万人)使用生成式 AI 获取心理健康建议。尽管从治疗类应用到通用聊天机器人的这些系统都依赖基于大量心理学文献训练的 LLM,但它们对于以夸张语言、讽刺性积极表达、快速语义漂移和语境多义性为特征的青少年沟通模式的安全性尚未得到验证。在多起与 AI 聊天机器人互动相关的青少年死亡事件后,系统性评估已刻不容缓。我们提出两项 benchmark:(1) 64 条经母语者(ICC=0.72)和临床医生(kappa=0.78)验证的 Gen Alpha 心理健康表达;(2) 75 组多轮对话(780 轮),配有标准版/Gen Alpha 版对照。对治疗应用和通用聊天机器人背后的 LLM 架构——Claude、GPT-4o、Llama-3.1——的评估显示,模型能理解 76-82% 的词汇,但仅能对 64-72% 的临床风险做出正确校准,形成 10-14 个百分点(pp)的词汇-理解落差(p<.001, d>0.48),而人类治疗师中不存在这一落差(3pp, p=.22)。该落差具有架构一致性,且随模糊性增加而扩大(7pp → 18pp)。我们识别出六种失效模式:讽刺掩盖(29pp)、最小化接受(43pp)、非正式风格偏见(24pp)、风险分层模糊性(19pp)、语义漂移(19pp)、语境依赖型暴力(7pp)。模式会复合叠加;三种及以上叠加时漏检率达 94%。轻量级缓解措施无效;仅重度 scaffolding 能达到人类表现水平(成本为 6.4 倍)。鉴于 34% 的基线漏检率意味着每年估计有 146,880 起危机被遗漏,我们建议强制采用 human-in-the-loop 架构、季度性青少年专项验证、透明性能披露,以及面向青少年的心理健康 AI 监管框架。
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。