返回资讯列表

图源:arXiv cs.AI
ERPBench:评估 LLM Agent 在企业决策与竞争市场生态中的表现
2026年9月7日作者:AI铺子编辑部
大模型
04667v1 Announce Type: new 摘要:LLM Agent 正越来越多地被应用于企业工作流,但现有评估很少检验商业决策结论能否在不同竞争市场生态之间迁移
arXiv:2609.04667v1 Announce Type: new
摘要:LLM Agent 正越来越多地被应用于企业工作流,但现有评估很少检验商业决策结论能否在不同竞争市场生态之间迁移。我们提出 ERPBench,这是一个面向企业决策 Agent 的执行插桩 benchmark,基于一个六轮 ERP(Enterprise Resource Planning)模拟,涵盖联动定价、生产、采购、库存、财务以及共享市场竞争。ERPBench 在两种匹配的竞争市场生态中评估同一组 100 个固定问题:Solo 模式下,每个被测 LLM Agent 与固定的 rule-based 对手竞争;Arena 模式下,六个被测 LLM Agent 在同一共享市场中竞争。跨越六个模型家族,共产生 1,200 条模型级轨迹,覆盖 7,200 个决策轮次。在观测到的服务配置下,领先模型因生态而异:DeepSeek 在 Solo 中领先(平均估值 252.29M;平均排名 1.67),而 Gemini 在 Arena 中领先(263.95M;1.76)。两种生态在 100 个问题中仅对 21 个判定出相同的任务级胜者,且 Gemini 的末位率从 Solo 的 22% 降至 Arena 的 0%。ERPBench 支持成对评估企业 Agent 排名是否可在竞争市场生态间迁移,并辅以聚合执行干预分析。代码与 benchmark 资源见 https://github.com/GAIR-NLP/erp-bench。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。