[论文解读] Improving Compositional Generalization with Latent Structure and Data Augmentation
该论文提出了一种基于组合结构学习器(Compositional Structure Learner, CSL)的数据增强方法,该模型以准同步上下文无关文法(quasi-synchronous context-free grammar, QCFG)为骨干,是一种生成式模型,旨在提升神经序列到序列模型的组合泛化能力。通过从训练数据中诱导潜在的组合结构并生成合成训练样本,CSL增强了T5的微调效果,在诊断性任务和真实世界语义解析任务上均取得了当前最优性能,甚至优于T5-CSL集成模型。
Generic unstructured neural networks have been shown to struggle on out-of-distribution compositional generalization. Compositional data augmentation via example recombination has transferred some prior knowledge about compositionality to such black-box neural models for several semantic parsing tasks, but this often required task-specific engineering or provided limited gains. We present a more powerful data recombination method using a model called Compositional Structure Learner (CSL). CSL is a generative model with a quasi-synchronous context-free grammar backbone, which we induce from the training data. We sample recombined examples from CSL and add them to the fine-tuning data of a pre-trained sequence-to-sequence model (T5). This procedure effectively transfers most of CSL's compositional bias to T5 for diagnostic tasks, and results in a model even stronger than a T5-CSL ensemble on two real world compositional generalization tasks. This results in new state-of-the-art performance for these challenging semantic parsing tasks requiring generalization to both natural language variation and novel compositions of elements.
研究动机与目标
- 为解决神经序列到序列模型在已知元素的分布外组合上表现不佳的问题。
- 在不依赖任务特定架构设计或大量人工标注的前提下,提升对新组合的泛化能力。
- 开发一种数据增强方法,将结构化生成模型的组合偏差迁移至灵活的预训练序列到序列模型(如T5)中。
- 在真实世界语义解析基准上,实现优于现有方法(包括专用模型的集成)的性能表现。
提出的方法
- CSL作为生成模型进行训练,其骨干为从训练数据中自动诱导出的准同步上下文无关文法(QCFG)。
- 该模型学习输入-输出对的概率分布,从而能够递归重组训练样本,生成新的组合形式。
- 从CSL中采样合成训练样本,并与原始数据结合,用于微调预训练的T5序列到序列模型。
- 该方法利用了CSL的组合偏差,同时保留了T5处理自然语言变化和复杂表面形式的能力。
- CSL通过在文法规则上使用可微搜索算法进行端到端训练,实现了高覆盖率的文法诱导,且无需任务特定约束。
- 该方法扩展了先前工作,支持递归重组与概率采样,而早期方法通常采用固定或确定性重组方式。
实验结果
研究问题
- RQ1一种自监督、数据驱动的组合结构诱导方法,能否提升神经序列到序列模型的泛化能力?
- RQ2具有潜在QCFG结构的生成模型,与判别式模型相比,在将组合偏差迁移至预训练序列模型方面表现如何?
- RQ3通过组合重组生成的合成数据,在真实世界组合泛化任务上的性能提升程度如何?
- RQ4所提出的方法是否优于现有的数据增强技术(如GECA或使用固定文法的示例重组)?
- RQ5在CSL训练过程中引入未标注数据,对下游泛化性能有何影响?
主要发现
- 在CFQ和COGS诊断任务上,使用CSL增强数据微调的T5模型取得了当前最优性能,优于基线T5模型和T5-CSL集成模型。
- 在真实世界SMCalFlow-CS数据集上,T5+CSL-Aug在跨域泛化任务上相比基线T5模型实现了7.8%的绝对性能提升。
- 在GeoQuery数据集上,该方法在三次运行中平均准确率达到93.3%,标准差为0.2,表现出高度稳定性和优异性能。
- 当仅采样1,000个合成样本时,引入未标注数据可提升性能;但在采样100,000个样本时,性能增益微乎其微,表明可能存在饱和或覆盖极限。
- 错误分析显示,约60%的单领域错误和约35%的跨域错误源于标注不一致或模糊,表明标注质量是主要瓶颈。
- 该模型在处理跨域示例中的深层嵌套程序结构时表现不佳,特别是在查询多级组织架构图时,表明其在处理复杂组合性方面存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。