返回资讯列表
ESQ-Bench:面向NL2SQL方言泛化与静默语义分歧评估的企业级Oracle多层级基准测试

ESQ-Bench:面向NL2SQL方言泛化与静默语义分歧评估的企业级Oracle多层级基准测试

2026年8月27日作者:AI铺子编辑部
行业动态

23569v1 Announce Type: new Abstract: 当前最先进的 Natural Language to SQL(NL2SQL)模型在 Spider、BIRD 等主流 benchmark 上报告的执行准确率(execution accuracy)已超过 89%

arXiv:2608.23569v1 Announce Type: new Abstract: 当前最先进的 Natural Language to SQL(NL2SQL)模型在 Spider、BIRD 等主流 benchmark 上报告的执行准确率(execution accuracy)已超过 89%。然而,这些 benchmark 依赖简化的学术 schema 与开源 SQL dialect,无法反映企业级数据库环境的真实复杂度。本文推出 ESQ-Bench——一个以 Oracle 为优先、具备系统化复杂度分级与 silent-divergence 评估机制的 NL2SQL benchmark,覆盖三个企业级 schema 复杂度层级。我们构建并发布了六个已填充数据的 schema(465 张表、164,682 行、零空表),在 Oracle、PostgreSQL、MySQL 与 SQL Server 上使用相同 seed data;同时提供四指标评估框架(EM、EX、SR、SD)以及 550 组经 gold 验证的 question-query 对(Tier-1: 95;Tier-2: 228;Tier-3: 227)。采用 schema-linked prompting 的 GPT-4o 在各层级呈现单调的 execution-match 退化:对实际执行的查询,EX 分别为 79.8%、60.3% 与 57.2%(2026 年 6 月数据),而此前 142 题的 pilot slice 上则为 75.6%、80.4% 与 95.8%。EM 在全层级均低于 7%;在通过 EX 的查询中,operational silent-divergence 高达 73% 至 99%。失效分析表明,错误结果语义(wrong-result semantics)在更高层级占主导。Claude Sonnet 4.6 配合 schema-linked prompts 对实际执行查询的 EX 达到 87.4%、74.9% 与 68.7%,在每个层级均超越 GPT-4o schema-linked。GPT-4o zero-shot 对实际执行查询的 EX(78.7%、73.5%、77.8%)在 Tier 2 至 Tier 3 出现与 schema-linked 的倒挂,原因在于 zero-shot 相较于 schema-linked 的执行率更低,存在 survivor bias。本地部署的 Llama 3.2 schema-linked 在全部 550 题中仅达到 13.3% 的 bank-wide EX(73/550),凸显了 closed API 模型与 open-weight baseline 在企业级 Oracle schema 上的显著差距。
来源:arXiv cs.AI | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明