Skip to main content
QUICK REVIEW

[论文解读] ColloQL: Robust Cross-Domain Text-to-SQL Over Search Queries

Karthik Radhakrishnan, Arvind Srikantan|arXiv (Cornell University)|Oct 19, 2020
Topic Modeling参考文献 24被引用 7
一句话总结

该论文提出 ColloQL,一种鲁棒的文本到 SQL 模型,通过数据增强和内容感知的 BERT 建模,结合两种采样策略——随机采样与相关性采样,有效处理嘈杂、口语化、搜索风格的查询。该模型在 WikiSQL 上实现了最先进性能(逻辑形式准确率为 84.9%,执行准确率为 90.7%),且无需执行引导解码,同时引入了一个包含 400 个简化、模糊查询的新基准数据集,用于跨领域的评估。

ABSTRACT

Translating natural language utterances to executable queries is a helpful technique in making the vast amount of data stored in relational databases accessible to a wider range of non-tech-savvy end users. Prior work in this area has largely focused on textual input that is linguistically correct and semantically unambiguous. However, real-world user queries are often succinct, colloquial, and noisy, resembling the input of a search engine. In this work, we introduce data augmentation techniques and a sampling-based content-aware BERT model (ColloQL) to achieve robust text-to-SQL modeling over natural language search (NLS) questions. Due to the lack of evaluation data, we curate a new dataset of NLS questions and demonstrate the efficacy of our approach. ColloQL's superior performance extends to well-formed text, achieving 84.9% (logical) and 90.7% (execution) accuracy on the WikiSQL dataset, making it, to the best of our knowledge, the highest performing model that does not use execution guided decoding.

研究动机与目标

  • 解决将嘈杂、简短且模糊的搜索风格自然语言查询转化为可执行 SQL 查询的挑战。
  • 提升文本到 SQL 模型在真实世界场景中的泛化能力,超越现有基准中常见的语法完整、结构良好的句子。
  • 通过使用采样后的表内容而非完整表扫描来减少推理成本和内存占用,实现表内容消歧。
  • 创建一个包含 400 个简化、模糊查询的新基准数据集,用于评估真实世界搜索风格输入下的性能。
  • 证明内容感知的 BERT 建模结合采样策略可提升在口语化和标准文本到 SQL 任务中的鲁棒性与准确性。

提出的方法

  • 通过模板进行数据增强,从 WikiSQL 数据集中语法完整句子生成合成的、简短的、口语化风格的问题。
  • 采用内容感知的 BERT 编码器,将采样后的表内容(随机或基于相关性)引入,以消解查询中模糊的列引用。
  • 对表值进行随机采样,以减少内存和推理开销,同时保持消歧能力。
  • 基于相关性的采样方法,通过匹配问题中的词元与列类型及数据分布,选择最可能解决歧义的表值。
  • 离线为每列生成采样样本,以支持快速推理,并适应个性化或分布偏移变化。
  • 在增强数据上进行模型微调,并在原始 WikiSQL 和新整理的简化查询数据集上进行评估。

实验结果

研究问题

  • RQ1数据增强能否提升文本到 SQL 模型对口语化、简短且模糊的搜索风格查询的鲁棒性?
  • RQ2不同表内容引入的采样策略如何影响消歧性能与推理效率?
  • RQ3内容感知的 BERT 模型是否能在无需执行引导解码的情况下,在 WikiSQL 等标准基准上实现最先进性能?
  • RQ4在模糊查询场景中,内容采样在多大程度上减少了对完整表扫描的需求,同时保持准确性?
  • RQ5所提出的模型在新基准数据集(包含 400 个简化、模糊查询)上的表现如何,该数据集旨在测试对缺失或隐式列引用的鲁棒性?

主要发现

  • ColloQL 在 WikiSQL 测试集上达到 84.9% 的逻辑形式准确率和 90.7% 的执行准确率,优于所有不使用执行引导解码的先前模型。
  • 该模型在简化、模糊查询上保持高性能——在预测 where 子句列时准确率达 97.2%,表明其对口语化输入具有强鲁棒性。
  • 通过模板进行内容增强可提升泛化能力,当使用增强数据微调时,原始 WikiSQL 验证集上的逻辑形式准确率从 79.5% 提升至 80.6%。
  • 基于相关性的采样在模糊场景下表现更优(简化查询上逻辑形式准确率为 87.0%),优于随机采样(83.2%),尤其在歧义情境下优势明显。
  • 使用相关性采样时,ColloQL 在 700 万行表(18GB 内存)上的推理时间为 15 秒,远快于 NL2SQL base 模型(200 秒),具备实时应用可行性。
  • 错误分析显示,聚合预测错误主要源于 WikiSQL 中标签的噪声,而 select 列错误则源于对列角色解释的歧义,尤其在使用缩写列名的电报式查询中更为显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。