[论文解读] Learning Contextual Representations for Semantic Parsing with Generation-Augmented Pre-Training
本文提出生成增强预训练(GAP)框架,通过利用大型语言模型生成的合成数据,联合预训练自然语言语句与数据库模式的上下文表征,从而增强文本到SQL的语义解析。通过引入三种新型预训练任务——列预测、列恢复和模式感知生成,GAP显著提升了列检测、模式对齐和复杂查询构造能力,在Spider和Criteria-to-SQL基准上均取得最先进性能。
Most recently, there has been significant interest in learning contextual representations for various NLP tasks, by leveraging large scale text corpora to train large neural language models with self-supervised learning objectives, such as Masked Language Model (MLM). However, based on a pilot study, we observe three issues of existing general-purpose language models when they are applied to text-to-SQL semantic parsers: fail to detect column mentions in the utterances, fail to infer column mentions from cell values, and fail to compose complex SQL queries. To mitigate these issues, we present a model pre-training framework, Generation-Augmented Pre-training (GAP), that jointly learns representations of natural language utterances and table schemas by leveraging generation models to generate pre-train data. GAP MODEL is trained on 2M utterance-schema pairs and 30K utterance-schema-SQL triples, whose utterances are produced by generative models. Based on experimental results, neural semantic parsers that leverage GAP MODEL as a representation encoder obtain new state-of-the-art results on both SPIDER and CRITERIA-TO-SQL benchmarks.
研究动机与目标
- 解决文本到SQL解析中的三个关键痛点:未能检测到列提及、无法从单元格值推断列名,以及难以构造复杂SQL查询。
- 通过有针对性的预训练目标,提升预训练语言模型中自然语言语句与数据库模式之间的对齐能力。
- 通过合成数据和结构化预训练任务引入领域特定知识,提升模型在跨领域设置下的泛化能力。
- 开发一种联合学习语句与表格模式表征的预训练框架,利用生成增强的合成数据。
- 通过将领域感知预训练目标整合到统一框架中,实现在标准文本到SQL基准上的最先进性能。
提出的方法
- 利用大型语言模型生成200万条合成的语句-模式配对和3万条语句-模式-SQL三元组作为预训练数据。
- 引入列预测任务,对每个模式列是否在语句中被引用进行分类,以提升显式列检测能力。
- 设计列恢复任务,将列名替换为其单元格值,要求模型重建原始列名,以增强隐式模式理解能力。
- 开发模式感知生成任务,使模型基于给定的模式元素生成语句,以强化联合表征学习。
- 使用掩码语言建模与三项新目标相结合的方式预训练模型,探测实验中编码器保持固定。
- 在下游文本到SQL任务上,使用标准序列到序列训练方式,对最终模型进行微调,其中使用预训练的编码器。
实验结果
研究问题
- RQ1生成增强预训练能否提升文本到SQL解析中显式提及列的检测能力?
- RQ2合成数据与专用预训练任务能否增强模型从语句中的单元格值推断列名的能力?
- RQ3与模式感知生成联合预训练能否提升包含嵌套子句的复杂SQL查询的生成能力?
- RQ4所提出的预训练目标在捕捉语句-模式对齐方面,相较于标准掩码语言建模有多大优势?
- RQ5GAP框架在分布外和低资源设置下是否具备泛化能力,如在Criteria-to-SQL等基准上的表现所示?
主要发现
- GAP模型在Spider基准上取得新的最先进结果,优于仅依赖标准预训练的先前模型。
- 在值-列匹配探测任务中,包含全部三项目标(MLM + CRec + CPred)的GAP模型达到44.51%的准确率,显著高于BART基线(23.17%)。
- 仅列预测任务即可将匹配准确率提升至44.51%,证明其在增强显式列检测方面的有效性。
- 列恢复任务(CRec)在值-列匹配中实现36.78%的准确率,表明其提升了隐式模式理解能力。
- 引入模式感知生成目标有助于提升复杂查询生成的泛化能力与鲁棒性,尤其在嵌套和多子句查询中表现更优。
- GAP模型在Criteria-to-SQL基准上优于现有模型,证实其在低资源和分布外设置下的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。