返回资讯列表
面向智能手术室的语音交互式多Agent系统:架构设计与关键技术

面向智能手术室的语音交互式多Agent系统:架构设计与关键技术

2026年9月12日作者:AI铺子编辑部
行业动态

11231v1 公告类型:new 摘要:本文提出 SurgicalRoomAgent——一种基于大语言模型(LLM)的语音交互式多 Agent 智能手术室系统

arXiv:2609.11231v1 公告类型:new 摘要:本文提出 SurgicalRoomAgent——一种基于大语言模型(LLM)的语音交互式多 Agent 智能手术室系统。该系统采用分层架构,由语音交互流水线(唤醒、ASR、轮次检测、Agent 推理、TTS)与 Agent 核心(技能注册表、任务规划器、设备管理器)组成,实现自然语言理解、设备控制、术中记录以及手术报告生成。研究了三项关键技术:(1)面向低延迟推理的 KV Cache 前缀预热,通过字节级最长公共前缀复用,将重计算开销从约 500 ms 降至数十毫秒;(2)流式部分 JSON 解析与提前并行任务执行,使端到端延迟降低约 30%;(3)渐进式技能提示披露,基于用户角色、已连接设备与手术阶段动态过滤系统提示,以在有限上下文窗口内最大化信息密度。系统基于 Qwen3-27B 模型,采用 llama.cpp/sglang 推理引擎实现。实验分析表明,该系统可在 16,384 token 的上下文限制内有效运行,且多设备并行控制的响应时间满足手术室实时性要求。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明