返回资讯列表
ModularSQL:为 Text-to-SQL 多重性盲区提供运行时防护

ModularSQL:为 Text-to-SQL 多重性盲区提供运行时防护

2026年9月25日作者:AI铺子编辑部
学术

研究团队发现Text-to-SQL系统存在多重性盲区,标准Set-EX评估会折叠重复行导致遗漏错误。他们提出Multiset-EX评估标准,在BIRD-Dev数据集上发现5.81至6.79个百分点的稳定差距。

arXiv:2609.29573v1 公告类型:新发布 摘要:Text-to-SQL 系统正日益部署到生产数据库中,但通过 benchmark 评估的查询仍可能产生扭曲下游工作流的结果。标准的基于集合的执行准确率(Set-EX)会折叠重复行,因此可能遗漏 multiplicity 错误,包括缺失 DISTINCT、聚合值虚高以及笛卡尔积式 join 爆炸。 我们将此称为 Multiplicity Blind Spot(MBS),并提出 Multiset-EX——一种保留 multiplicity 的评估标准,用以暴露此类失效。在可执行的 BIRD-Dev N=1532 上,针对三个 backbone(Qwen2.5-Coder-32B、Qwen3-Coder-30B-A3B 和 Gemma-3-27B)发布的 DeepEye-SQL 产物中,我们发现 Set-EX 与 Multiset-EX 之间存在 5.81--6.79 个百分点的稳定差距。该差距并非 DeepEye-SQL 特有:在已发布的 DAIL-SQL+GPT-4(5.22 个百分点)和 BIRD GPT-3.5-turbo(3.39 个百分点)预测上依然存在。 我们进一步提出 ModularSQL——一种轻量级 post-selection 运行时护栏,它探测执行结果中的 multiplicity 异常,并仅对被标记的查询应用确定性补丁或低成本 LLM 修复。将 ModularSQL 与使用 Qwen3-Coder 的 DeepEye-SQL 集成后,在保持 72.06% Set-EX 的同时,将 Multiset-EX 从 65.86% 提升至 67.75%(+1.89 个百分点)。它标记出 77 个高风险异常,而新增 LLM 总成本仅为 $0.0076,摊销到每查询的延迟仅为 120 ms。跨流水线评估表明,该无需候选集的检测器与确定性补丁也可迁移到独立发布的预测集。总体而言,这些结果表明 benchmark 准确率并不必然意味着执行安全的 SQL,而轻量级、具备 multiplicity 感知能力的运行时护栏能够以适度的计算开销缩小这一差距。
来源:arXiv cs.CL | 查看原文

本文内容仅供参考,不构成任何投资或使用建议。AI铺子不对文章内容的准确性承担责任。 详情请参阅免责声明。