返回资讯列表
VAmoS 续作:更硬核、更拟真的语音 Agent 模拟测试

VAmoS 续作:更硬核、更拟真的语音 Agent 模拟测试

2026年10月1日作者:AI铺子编辑部
学术产品

研究团队推出 VAmoS Energy 基准,用 100 通公用事业账单通话测试语音 Agent 的多请求处理与抗噪能力。测试配备 16 个工具和有状态账单系统,14 个语音技术栈的任务完成率仅 17.3% 至 44.7%。

arXiv:2609.38512v1 公告类型:新发布 摘要:生产环境中的语音 Agent 必须同时处理多项请求、背景人声,以及逐渐失去耐心的客户。我们推出 VAmoS Energy 基准,将上述挑战整合进 100 通关于公用事业账单与缴费协助的通话中。每位来电者会提出 2 至 4 项请求。Agent 配备 16 个工具,后端由有状态的 Stripe 账单孪生系统与 Apache Fineract 贷款引擎支撑;在完成来电者验证之前,账户访问将被阻断。任务采用公开的家庭用电数据,并基于宾夕法尼亚州住宅计费规则制定策略。LLM-as-a-verifier 会将 Agent 的操作与口头报出的数字,与明确要求逐项核对。在一次校准运行中,它与代码验证器在 99.1% 的检查项上结果一致。在覆盖 14 个语音技术栈、每项任务重复 3 次的测试中,任务完成率介于 17.3% 到 44.7% 之间。Grok Voice 领先,Gemini 3.8 Live 与 GPT-Live 紧随其后,且每通电话成本大致相当。背景电视噪声使合并完成率从 38.7% 降至 8.6%。模拟来电者往往会接受错误结果,因为它只能听到 Agent 的话语,却无法检查其实际操作。这些发现表明,语音 Agent 的评估必须覆盖整通电话,包括它们说了什么、改了什么,以及如何应对 competing speech。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。