Skip to main content
QUICK REVIEW

[论文解读] Did You Ask a Good Question? A Cross-Domain Question Intention Classification Benchmark for Text-to-SQL

Yusen Zhang, Xiangyu Dong|arXiv (Cornell University)|Oct 23, 2020
Topic Modeling参考文献 38被引用 6
一句话总结

本文提出了 TriageSQL,这是首个用于将文本到SQL问题意图分类为五种类别的跨领域基准:可回答、不适当、需要外部知识、模糊以及无法通过标准SQL语法回答。在39万组问题-数据库对上使用微调后的 RoBERTa 模型,其F1得分为60%,凸显了在区分复杂无法回答的问题方面面临的重大挑战,尤其是模糊和需要知识的问题。

ABSTRACT

Neural models have achieved significant results on the text-to-SQL task, in which most current work assumes all the input questions are legal and generates a SQL query for any input. However, in the real scenario, users can input any text that may not be able to be answered by a SQL query. In this work, we propose TriageSQL, the first cross-domain text-to-SQL question intention classification benchmark that requires models to distinguish four types of unanswerable questions from answerable questions. The baseline RoBERTa model achieves a 60% F1 score on the test set, demonstrating the need for further improvement on this task. Our dataset is available at https://github.com/chatc/TriageSQL.

研究动机与目标

  • 为解决文本到SQL系统中假设所有用户问题均可回答的缺陷,通过形式化和基准化无法回答的问题类型。
  • 构建一个高质量的跨领域数据集,包含39万组问题-数据库对,以及一个涵盖五种类别的2,500个示例的手动标注测试集。
  • 通过使用强大的基线模型,评估分类无法回答问题的难度,特别是模糊和依赖知识的问题。
  • 为未来研究提供一个标准化基准,以支持能够处理现实世界输入多样性的鲁棒文本到SQL系统。

提出的方法

  • 作者定义了五种类别的问题意图:可回答、不适当(例如闲聊)、需要外部知识(ExtKnow)、模糊(由于模式或值的模糊性)以及无法通过标准SQL语法回答(Non-SQL)。
  • 他们从20个现有数据集中收集并整理了34,000个数据库和390,000组问题-数据库对,并通过人工修订确保质量。
  • 通过人工标注构建了一个高质量的测试集,每种类别500个示例,以确保可靠性并减少标注偏差。
  • 在采样的训练集(每类最多10,000个样本)上对RoBERTa-base模型进行微调,作为五分类任务的强基线模型。
  • 该模型使用特殊标记分隔问题和模式中的每一列,从而实现自然语言与数据库结构的联合编码。
  • 作者通过混淆矩阵和消融研究分析模型的混淆情况,特别考察了未提及列对ExtKnow与可回答分类的影响。

实验结果

研究问题

  • RQ1不同类型的无法回答问题——如需要外部知识、模糊或违反标准SQL语法的问题——如何挑战文本到SQL系统?
  • RQ2预训练语言模型(如RoBERTa)在跨领域设置下,能在多大程度上区分可回答与无法回答的问题?
  • RQ3导致模型混淆的关键因素是什么,特别是ExtKnow与可回答问题之间的混淆?非提及列的存在如何影响分类?
  • RQ4在可回答问题中包含非提及列如何影响模型性能和泛化能力?

主要发现

  • 基于RoBERTa的基线模型在测试集上平均F1得分为60%,表明在处理无法回答问题方面仍有巨大改进空间。
  • 该模型在不适当和Non-SQL问题类型上的表现最佳,F1得分超过70%,表明这些类别更容易检测。
  • 该模型在模糊问题上的表现显著不佳,F1得分仅为17%,凸显了在文本到SQL中解决语义模糊性的内在困难。
  • ExtKnow与可回答问题之间的混淆程度很高,模型在ExtKnow上的F1得分为49%,在可回答问题上为63%,表明检测缺失的模式信息存在困难。
  • 从可回答问题中移除非提及列后,ExtKnow和可回答两类的F1得分均有所提升,表明此类示例是主要的混淆来源。
  • 消融研究证实,非提及列是关键的混淆因素,因为包含此类示例的数据集训练出的模型性能更差,即使训练数据量更大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。