Skip to main content
QUICK REVIEW

[论文解读] On the Potential of Lexico-logical Alignments for Semantic Parsing to SQL Queries

Tianze Shi, Chen Zhao|arXiv (Cornell University)|Oct 21, 2020
Natural Language Processing Techniques参考文献 5被引用 4
一句话总结

本文提出了Squall,一个大规模语义解析数据集,包含11,276个WikiTableQuestions的手动词汇到SQL对齐。通过在编码器-解码器模型中引入监督注意力和列引用预测,作者在强基线模型上实现了4.4%的执行准确率绝对提升,证明细粒度词汇监督能显著提升语义解析性能。

ABSTRACT

Large-scale semantic parsing datasets annotated with logical forms have enabled major advances in supervised approaches. But can richer supervision help even more? To explore the utility of fine-grained, lexical-level supervision, we introduce Squall, a dataset that enriches 11,276 WikiTableQuestions English-language questions with manually created SQL equivalents plus alignments between SQL and question fragments. Our annotation enables new training possibilities for encoder-decoder models, including approaches from machine translation previously precluded by the absence of alignments. We propose and test two methods: (1) supervised attention; (2) adopting an auxiliary objective of disambiguating references in the input queries to table columns. In 5-fold cross validation, these strategies improve over strong baselines by 4.4% execution accuracy. Oracle experiments suggest that annotated alignments can support further accuracy gains of up to 23.9%.

研究动机与目标

  • 探究细粒度词汇监督(即问题到SQL片段的对齐)是否能提升语义解析性能。
  • 构建一个大规模、高质量的数据集——Squall,该数据集同时提供SQL逻辑形式以及自然语言问题与其对应SQL组件之间的手动词汇级对齐。
  • 评估两种新颖训练策略(监督注意力和列预测)在标注对齐数据上的有效性。
  • 评估词汇对齐在超越当前最先进模型性能方面的潜力。
  • 分析词汇对齐的标注成本和学习曲线,以确定其在语义解析中的成本效益。

提出的方法

  • 对11,276个WikiTableQuestions进行标注,提供其SQL等价形式以及问题词元与SQL片段之间的手动对齐,从而构建Squall数据集。
  • 使用监督注意力训练序列到序列模型,即在编码和解码过程中,注意力权重由人工标注的对齐关系引导。
  • 引入一个列预测头,利用BERT特征预测问题片段所指的表列。
  • 在Squall开发集上使用五折交叉验证,比较使用和不使用词汇监督的模型。
  • 使用逻辑形式准确率(完全匹配)和执行准确率(无论形式如何,只要答案正确)来评估模型性能。
  • 进行Oracle实验,即在测试时向模型提供完整对齐信息,以估计潜在提升的上限。

实验结果

研究问题

  • RQ1人工进行的词汇到逻辑形式对齐是否能显著提升语义解析准确率,超越仅使用逻辑形式的常规监督?
  • RQ2当具备细粒度对齐监督时,监督注意力和列引用预测作为训练策略的有效性如何?
  • RQ3在推理阶段完全访问词汇对齐信息时,性能提升的上限是多少?
  • RQ4与完整逻辑形式标注相比,标注词汇对齐的成本效益如何?
  • RQ5添加对齐监督是否能提升模型的泛化能力,特别是在词汇变化或改写的情况下?

主要发现

  • 在五折交叉验证中,同时采用监督注意力和列预测的所提方法相比仅使用逻辑形式的强基线,执行准确率提升了4.4%。
  • 监督编码器注意力是效果最显著的单一组件,相比基线使执行准确率绝对提升了3.8%。
  • 列预测使执行准确率绝对提升了1.3%,表明引用消歧是一种有价值的信号。
  • 使用完整对齐信息进行测试的Oracle模型在逻辑形式准确率上最高实现了23.9%的绝对提升,揭示了巨大的未实现潜力。
  • 与完整逻辑形式标注相比,词汇对齐的标注时间不足其一半,表明具有很强的成本效益。
  • 仅使用5%的对齐样本进行训练,执行准确率就提升了2.5个百分点,表明部分对齐标注具有高度有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。