Skip to main content
QUICK REVIEW

[论文解读] AutoQA: From Databases To QA Semantic Parsers With Only Synthetic Training Data

Silei Xu, Sina J. Semnani|arXiv (Cornell University)|Oct 9, 2020
Natural Language Processing Techniques参考文献 42被引用 4
一句话总结

AutoQA 是一个完全自动化的工具包,仅使用合成训练数据即可为数据库上的问答任务生成语义解析器,无需人工标注或人工改写。它利用自动改写和经过筛选的自动改写器生成多样化、高质量的训练样本,在 Schema2QA 上达到 62.9% 的逻辑形式准确率,在 Overnight 上达到 69.8% 的答案准确率,分别比使用专家标注数据训练的模型低 6.4% 和 5.2%。

ABSTRACT

We propose AutoQA, a methodology and toolkit to generate semantic parsers that answer questions on databases, with no manual effort. Given a database schema and its data, AutoQA automatically generates a large set of high-quality questions for training that covers different database operations. It uses automatic paraphrasing combined with template-based parsing to find alternative expressions of an attribute in different parts of speech. It also uses a novel filtered auto-paraphraser to generate correct paraphrases of entire sentences. We apply AutoQA to the Schema2QA dataset and obtain an average logical form accuracy of 62.9% when tested on natural questions, which is only 6.4% lower than a model trained with expert natural language annotations and paraphrase data collected from crowdworkers. To demonstrate the generality of AutoQA, we also apply it to the Overnight dataset. AutoQA achieves 69.8% answer accuracy, 16.4% higher than the state-of-the-art zero-shot models and only 5.2% lower than the same model trained with human data.

研究动机与目标

  • 消除在数据库问答任务中训练语义解析器时高昂的人工数据标注成本。
  • 开发一个完全自动化的流水线,生成高质量的训练数据,无需依赖专家标注的逻辑形式或众包工作者生成的改写句。
  • 评估通过自动改写增强的合成数据是否能与使用人工标注数据训练的模型性能相当。
  • 展示在多样化数据库和逻辑形式上的泛化能力,包括知识库和网页模式数据集。

提出的方法

  • AutoQA 使用预训练的改写模型,自动为数据库属性标注不同词性下的替代表达方式。
  • 采用基于模板的数据合成方法,从标注后的属性生成大量多样化、复杂的问答问题。
  • 基于 BART 的新型过滤式自动改写器生成自然语言改写句,通过过滤机制确保语义保真度,验证改写句是否与原始句子映射到相同的逻辑形式。
  • 将过滤后的改写句迭代用于通过自训练重新训练语义解析器,提升对语言变化的鲁棒性。
  • 最终的解析器是一个仅在合成、自动标注和自动改写数据上训练的 BERT-LSTM 模型。
  • 该流水线在 Schema2QA 和 Overnight 基准上进行评估,使用逻辑形式准确率和答案准确率作为指标。

实验结果

研究问题

  • RQ1能否仅使用合成训练数据,无需任何人工标注样本,训练出高准确率的语义解析器?
  • RQ2自动改写(尤其是经过语义正确性筛选的)在提升对未见自然语言问题的泛化能力方面有多有效?
  • RQ3使用改写模型对数据库属性进行自动标注,在多大程度上可以替代人工整理的属性同义词?
  • RQ4完全基于合成数据训练的流水线性能与使用人工标注改写句训练的最先进模型相比如何?

主要发现

  • 在 Schema2QA 数据集上,AutoQA 在自然问题上达到 62.9% 的逻辑形式准确率,仅比使用专家标注数据和人工改写句训练的模型低 6.4%。
  • 在 Overnight 基准上,AutoQA 达到 69.8% 的答案准确率和 55.6% 的逻辑形式准确率,分别比最先进零样本模型高出 16.4 和 18.6 个百分点。
  • 完整的 AutoQA 流水线(结合自动标注和过滤式自动改写)优于单独使用任一组件,相比仅使用自动改写提升 6.4%,相比仅使用自动标注提升 8.3%。
  • 使用未经过滤的自动改写器会导致准确率下降 18%,证明在合成数据生成中语义过滤的必要性。
  • AutoQA 在 Overnight 数据集上的性能与使用领域内人工改写句训练的模型相比仅低 5.2%,表明其具备强大的零样本泛化能力。
  • 该方法在不同数据库模式和逻辑形式上均表现出泛化能力,对网页规模模式数据和知识库数据集均有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。