Skip to main content
QUICK REVIEW

[论文解读] CoSQL: A Conversational Text-to-SQL Challenge Towards Cross-Domain Natural Language Interfaces to Databases

Tao Yu, Rui Zhang|arXiv (Cornell University)|Sep 11, 2019
Topic Modeling参考文献 59被引用 44
一句话总结

CoSQL 引入一个大规模、跨领域对话文本到 SQL 语料库,通过 Wizard-of-Oz 设置收集,包含三个任务(基于 SQL 的 DST、从 SQL/结果生成 NL 响应,以及用户对话行为预测),以及基线评估显示仍有显著提升空间。

ABSTRACT

We present CoSQL, a corpus for building cross-domain, general-purpose database (DB) querying dialogue systems. It consists of 30k+ turns plus 10k+ annotated SQL queries, obtained from a Wizard-of-Oz (WOZ) collection of 3k dialogues querying 200 complex DBs spanning 138 domains. Each dialogue simulates a real-world DB query scenario with a crowd worker as a user exploring the DB and a SQL expert retrieving answers with SQL, clarifying ambiguous questions, or otherwise informing of unanswerable questions. When user questions are answerable by SQL, the expert describes the SQL and execution results to the user, hence maintaining a natural interaction flow. CoSQL introduces new challenges compared to existing task-oriented dialogue datasets:(1) the dialogue states are grounded in SQL, a domain-independent executable representation, instead of domain-specific slot-value pairs, and (2) because testing is done on unseen databases, success requires generalizing to new domains. CoSQL includes three tasks: SQL-grounded dialogue state tracking, response generation from query results, and user dialogue act prediction. We evaluate a set of strong baselines for each task and show that CoSQL presents significant challenges for future research. The dataset, baselines, and leaderboard will be released at https://yale-lily.github.io/cosql.

研究动机与目标

  • 开发一个跨领域、通用数据库查询对话语料库,基于可执行的 SQL 表达来实现对话的落地。
  • 使得基于 SQL 的对话状态、从 SQL 结果生成自然语言响应,以及用户/对话行为预测的评估成为可能。
  • 评估基线模型,以揭示在对话环境中自然、澄清和可验证的基于 SQL 的数据库查询所面临的挑战。
  • 突出跨领域对未见数据库的泛化能力,以及需要能够解释 SQL 和结果的系统响应的必要性。

提出的方法

  • 收集一个大规模、跨领域的 WOZ 对话数据集,包含 3,007 条对话和 30k+ 次对话轮次,覆盖 200 个数据库、138 个领域。
  • 为每个轮次标注可执行的 SQL 查询(10k 条带标签的查询)和对话行为。
  • 定义三个任务基准:基于 SQL 的对话状态追踪、从执行的 SQL 及结果生成响应,以及用户对话行为预测。
  • 对 DST 基准强基线进行评测(如 CD-Seq2Seq 和 SyntaxSQL-con),并使用基于模板、Seq2Seq 和指针生成器的方法评估响应生成。
  • 提供关于数据多样性、跨域泛化能力,以及对话中使用的 SQL 复杂度的分析。

实验结果

研究问题

  • RQ1系统能否在给定跨域模式的情况下判断用户问题是否能被 SQL 回答?
  • RQ2模型在未见数据库中将用户话语落地为可执行的 SQL 查询的能力有多强?
  • RQ3系统能否生成自然语言回应,忠实描述 SQL 查询和结果以便验证?
  • RQ4在本设置中,用户对话行为(如 AMBIGUOUS、INFER_SQL、CANNOT_UNDERSTAND)的预测准确度有多高?

主要发现

  • 基线 DST 模型在 CoSQL 上实现不到 16% 的按问题级准确性和不到 3% 的按交互级准确性,表明难度高于 SParC。
  • 响应生成基线显示有限的 BLEU 分数和较低的逻辑正确性;指针生成器通常优于原生 Seq2Seq,但在将 SQL 逻辑保留到 NL 输出方面仍然困难。
  • 约 40% 的用户问题是 AMBIGUOUS,需要系统澄清;约 10% 涉及 INFER_SQL,凸显 NLIDB 系统对有效澄清和推理的需求。
  • 人工评估显示,基于模板的 NL 描述在语法连贯性上可能更好,但覆盖面有限且逻辑正确性低于神经方法;神经方法获得更高的 BLEU,但在逻辑一致性方面仍有困难。
  • CoSQL 在训练集中覆盖 200 个数据库和 1020 个表,具有长尾语言和多样化的话语,凸显跨域泛化挑战。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。