Skip to main content
QUICK REVIEW

[论文解读] Grounded Adaptation for Zero-shot Executable Semantic Parsing

Victor W. Zhong, Mike Lewis|arXiv (Cornell University)|Sep 16, 2020
Topic Modeling参考文献 28被引用 6
一句话总结

本文提出了一种零样本可执行语义解析的接地适配方法(GAZP),该方法通过在目标环境中合成高质量、循环一致的自然语言- SQL 对,将预训练的语义解析器适配到新环境(例如未见过的数据库)。GAZP 使用前向解析器和反向自然语言生成器生成数据,通过执行等价性验证一致性,并对解析器进行微调——在 Spider、Sparc 和 CoSQL 基准测试中均提升了逻辑形式准确率和执行准确率。

ABSTRACT

We propose Grounded Adaptation for Zero-shot Executable Semantic Parsing (GAZP) to adapt an existing semantic parser to new environments (e.g. new database schemas). GAZP combines a forward semantic parser with a backward utterance generator to synthesize data (e.g. utterances and SQL queries) in the new environment, then selects cycle-consistent examples to adapt the parser. Unlike data-augmentation, which typically synthesizes unverified examples in the training environment, GAZP synthesizes examples in the new environment whose input-output consistency are verified. On the Spider, Sparc, and CoSQL zero-shot semantic parsing tasks, GAZP improves logical form and execution accuracy of the baseline parser. Our analyses show that GAZP outperforms data-augmentation in the training environment, performance increases with the amount of GAZP-synthesized data, and cycle-consistency is central to successful adaptation.

研究动机与目标

  • 解决预训练语义解析器在缺乏标注训练数据的新推理环境(例如未见过的数据库模式)中适配的问题。
  • 通过在目标环境中生成高质量、一致性验证的训练数据,提升语义解析的零样本泛化能力。
  • 克服传统数据增强方法的局限性,后者在源环境中合成未经验证的样本,无法泛化到新领域。
  • 证明循环一致性和环境特定的数据合成对成功适配至关重要。
  • 提供一种即插即用的适配框架,兼容任意解析器架构,只要能够评估逻辑形式等价性即可。

提出的方法

  • GAZP 首先在源域数据上训练一个前向语义解析器和一个反向自然语言生成器,二者均以环境描述(例如数据库模式)为条件。
  • 在推理环境中,它使用基于新数据库模式的语法采样逻辑形式(例如 SQL 查询)。
  • 对每个采样的逻辑形式,使用训练好的反向生成器生成自然语言语句。
  • 然后在新环境中使用前向解析器解析生成的语句,并通过验证解析后的逻辑形式与原始采样形式是否等价来检查循环一致性。
  • 仅将循环一致的样本——即原始形式与重新解析形式等价的样本——用于在新环境中微调解析器。
  • 一致性通过执行等价性评估(即,当在新数据库上执行时,两种形式产生相同的语义结果)。

实验结果

研究问题

  • RQ1与在训练环境中进行数据增强相比,在新推理环境中直接合成数据是否能提升零样本语义解析的性能?
  • RQ2在生成的自然语言语句与其对应逻辑形式之间强制实现循环一致性,是否能生成更高质量的训练数据并提升适配效果?
  • RQ3GAZP 合成的数据量如何影响适配后解析器的性能?
  • RQ4GAZP 在 Spider、Sparc 和 CoSQL 等多样化的零样本语义解析基准测试中是否均有效?
  • RQ5只要能够评估逻辑形式等价性,GAZP 是否可应用于任意解析器架构?

主要发现

  • 与基线解析器相比,GAZP 在 Spider、Sparc 和 CoSQL 的零样本语义解析基准测试中,均提升了逻辑形式精确匹配率和执行准确率。
  • GAZP 在性能上优于在训练环境中进行的数据增强,表明在目标环境中进行合成对零样本适配更为有效。
  • 随着 GAZP 合成数据量的增加,适配性能持续提升,显示出正相关性,直至约 30–40k 个样本,之后增益逐渐减弱。
  • 循环一致性对成功适配至关重要,因为它能过滤掉低质量的生成样本,确保微调所用数据的高质量。
  • 基于执行的一致性与基于精确匹配的一致性表现相似,尽管执行准确率通常略低,表明执行是更鲁棒的一致性信号。
  • 该方法在多样化领域中均有效,且能良好泛化到未见过的数据库,证实其在零样本部署中的实用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。