返回资讯列表

图源:arXiv cs.AI
ESQ-Bench:面向NL2SQL方言泛化与静默语义偏差评估的多层级企业Oracle基准测试
2026年8月27日作者:AI铺子编辑部
行业动态
23569v1 Announce Type: new Abstract: 最先进的自然语言转 SQL(NL2SQL)模型在 Spider、BIRD 等主流 benchmark 上报告的执行准确率已超过 89%
arXiv:2608.23569v1 Announce Type: new
Abstract: 最先进的自然语言转 SQL(NL2SQL)模型在 Spider、BIRD 等主流 benchmark 上报告的执行准确率已超过 89%。然而,这些 benchmark 依赖简化的学术 schema 和开源 SQL 方言,无法反映企业数据库环境的复杂性。我们推出 ESQ-Bench,一个以 Oracle 为核心的 NL2SQL benchmark,具备系统化的复杂度分级和静默偏差(silent-divergence)评估机制,覆盖三个企业 schema 复杂度层级。我们构建并发布了六个已填充数据的 schema(465 张表、164,682 行数据、零空表),在 Oracle、PostgreSQL、MySQL 和 SQL Server 上使用相同的种子数据,配套四指标评估框架(EM、EX、SR、SD),以及 550 组经 gold 验证的问题-查询对(Tier-1: 95;Tier-2: 228;Tier-3: 227)。采用 schema-linked prompting 的 GPT-4o 在各层级呈现单调的执行匹配退化:在执行成功的查询中,EX 分别为 79.8%、60.3% 和 57.2%(2026 年 6 月),而在较早的 142 题 pilot 子集上则为 75.6%、80.4% 和 95.8%。EM 在全层级均低于 7%;在 EX 通过的查询中,操作性静默偏差高达 73% 至 99%。失效分析表明,错误结果语义(wrong-result semantics)在更高层级占主导。Claude Sonnet 4.6 配合 schema-linked prompts 达到 87.4%、74.9% 和 68.7% 的 EX(执行成功的查询),在每个层级均超过 GPT-4o schema-linked。GPT-4o zero-shot 在执行成功查询上的 EX(78.7%、73.5% 和 77.8%)在 Tier 2 至 Tier 3 出现与 schema-linked 的倒挂,原因是 zero-shot 相比 schema-linked 的执行率更低,存在幸存者偏差。本地部署的 Llama 3.2 schema-linked 在全库 EX 上仅达 13.3%(550 题中 73 题),凸显了 closed API 模型与 open-weight baseline 在企业 Oracle schema 上的差距。
来源:arXiv cs.AI | 查看原文
本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。