返回资讯列表

EmailBench:企业邮件与生产力任务 LLM Agent 评测基准
2026年9月29日作者:AI铺子编辑部
大模型
EmailBench 是一个面向企业邮件与生产力任务的大模型 Agent 评测基准。它覆盖 16 类任务、206 个场景,结合静态断言与评分细则。结果显示最强配置仅通过 33.5% 场景,说明工具调用成功不等于任务完成。
arXiv:2609.31906v1 公告类型:新发布
摘要:企业级邮件 Agent 必须同时具备信息检索、结构化状态变更、时序推理与多步协调能力。近期的 Agent benchmark 虽包含生产力任务,但很少有以自包含环境中的类型化邮件工作流为核心。我们推出 EmailBench——一个涵盖 16 个任务类别、共 206 个邮件与生产力场景的 benchmark。该 benchmark 将带有与服务商无关命名的类型化邮件 API 规范、一个确定性的合成 Enron 风格语料库,以及场景套件相结合;其主题选择参考了来自交互式原型的聚合任务意图遥测数据。其混合评估协议结合了 258 项可执行的静态断言与 211 条 LLM rubric。我们在固定的单用户语料库上评估了八种 LM 配置。表现最佳的配置也仅通过 33.5% 的场景,尽管其 99.7% 的 tool 调用在未观察到 API 失败的情况下完成,且各任务类别的通过率差异显著。这一差距表明,有效的工具执行并不等同于任务完成。EmailBench 为端到端邮件 Agent 评估提供了一个自包含环境;更广的工具覆盖、多 persona 测试以及重复运行评估则是未来的工作方向。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。