Skip to main content
QUICK REVIEW

[论文解读] Learning to Recombine and Resample Data for Compositional Generalization

Ekin Akyürek, Afra Feyza Akyürek|arXiv (Cornell University)|Oct 8, 2020
Geochemistry and Geologic Mapping参考文献 53被引用 10
一句话总结

本文提出 R&R,一种通过原型生成模型重新组合训练样本并优先采样罕见子结构的可学习数据增强方法,无需符号结构即可提升神经序列模型在少样本组合泛化任务中的表现。通过在训练数据中重新组合样本并重新采样以突出罕见子结构,R&R 使序列模型仅用八组样本即可泛化到未见过的句式和时态,其在 SCAN 和 Sigmorphon 2018 任务上的表现优于标准神经模型及神经符号基线方法。

ABSTRACT

Flexible neural sequence models outperform grammar- and automaton-based counterparts on a variety of tasks. However, neural models perform poorly in settings requiring compositional generalization beyond the training data -- particularly to rare or unseen subsequences. Past work has found symbolic scaffolding (e.g. grammars or automata) essential in these settings. We describe R&R, a learned data augmentation scheme that enables a large category of compositional generalizations without appeal to latent symbolic structure. R&R has two components: recombination of original training examples via a prototype-based generative model and resampling of generated examples to encourage extrapolation. Training an ordinary neural sequence model on a dataset augmented with recombined and resampled examples significantly improves generalization in two language processing problems -- instruction following (SCAN) and morphological analysis (SIGMORPHON 2018) -- where R&R enables learning of new constructions and tenses from as few as eight initial examples.

研究动机与目标

  • 为解决标准神经序列模型在少样本组合泛化任务中,尤其是对罕见或未见子结构表现失败的问题。
  • 探究显式符号结构是否为神经模型实现系统性泛化的必要条件。
  • 开发一种仅从数据中学习归纳偏置的数据增强框架,无需依赖语法规则或自动机。
  • 在极小监督下提升对过去时态屈折变化、复杂指令等语言构造的学习能力。

提出的方法

  • 训练一个基于原型的生成模型,通过重组其他训练样本中的片段来重建训练对 (x → y)。
  • 使用训练好的生成模型采样合成训练样本,优先选择包含罕见标记或子结构的输出。
  • 通过重采样筛选并优先选择强调罕见或分布外模式的高质量合成样本。
  • 在增强数据集上微调标准神经序列模型,以提炼其组合泛化能力。
  • 使用重构损失优化生成模型,以在重组过程中保持结构与语义一致性。
  • 采用基于温度的采样策略,在数据增强过程中鼓励探索罕见与新颖的子结构。

实验结果

研究问题

  • RQ1神经序列模型是否能在无符号结构支持的少样本设置下实现系统性组合泛化?
  • RQ2从现有训练样本中学习重组与重采样数据,是否足以提供超越训练分布的泛化归纳偏置?
  • RQ3基于原型的生成方法进行数据增强,是否能优于依赖显式语法规则或规则系统的神经符号方法?
  • RQ4R&R 在极小监督下对未见语言构造的泛化能力有多高效?
  • RQ5重采样对罕见现象的合成训练样本质量与多样性有何影响?

主要发现

  • R&R 显著提升了 SCAN 任务上的少样本组合泛化性能,仅用八组训练样本即可准确预测复杂指令。
  • 在 Sigmorphon 2018 词形分析任务中,R&R 使模型能够学习并泛化新型屈折模式,包括罕见与未见时态。
  • 表现最佳的 R&R 变体(recomb-1 + resampling)在 SCAN 与 Sigmorphon 2018 任务上均达到最先进性能,优于神经符号基线。
  • 重采样提升了合成样本的质量,增加了增强数据中正确且新颖的屈折形式比例。
  • 该方法无需符号结构即可实现上述效果,证明归纳偏置可仅通过数据重组自发产生。
  • 整个流程(包括生成模型训练、采样与条件模型微调)在单张 GPU 上每项实验耗时不足一小时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。