Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Recombine and Resample Data for Compositional Generalization

Ekin Akyürek, Afra Feyza Akyürek|arXiv (Cornell University)|Oct 8, 2020
Geochemistry and Geologic Mapping参考文献 53被引用数 10
ひとこと要約

本論文は、記号的構造を用いない神経系列モデルにおける少数ショット構成的一般化を向上させる、学習されたデータ拡張手法R&Rを提案する。プロトタイプに基づく生成モデルを用いて訓練例を再結合し、希少な部分構造を優先して再サンプリングすることで、R&Rは8例の最小限の例からの未観測構造や時態への一般化を可能にし、SCANおよびSigmorphon 2018タスクにおいて、標準的ニューラルモデルおよび神経記号的ベースラインを上回る性能を発揮する。

ABSTRACT

Flexible neural sequence models outperform grammar- and automaton-based counterparts on a variety of tasks. However, neural models perform poorly in settings requiring compositional generalization beyond the training data -- particularly to rare or unseen subsequences. Past work has found symbolic scaffolding (e.g. grammars or automata) essential in these settings. We describe R&R, a learned data augmentation scheme that enables a large category of compositional generalizations without appeal to latent symbolic structure. R&R has two components: recombination of original training examples via a prototype-based generative model and resampling of generated examples to encourage extrapolation. Training an ordinary neural sequence model on a dataset augmented with recombined and resampled examples significantly improves generalization in two language processing problems -- instruction following (SCAN) and morphological analysis (SIGMORPHON 2018) -- where R&R enables learning of new constructions and tenses from as few as eight initial examples.

研究の動機と目的

  • 標準的ニューラル系列モデルが、希少または未観測の部分構造に対して少数ショット構成的一般化で失敗する問題に対処すること。
  • 神経モデルにおける体系的一般化に、明示的な記号的構造が必要かどうかを調査すること。
  • 文法やオートマトンに依存せずに、データそのものから帰納的バイアスを学ぶデータ拡張フレームワークを開発すること。
  • 最小限の監視情報から、過去形語尾変化や複雑な命令文などの言語的構造の少数ショット学習を改善すること。

提案手法

  • 他の訓練例からの断片を再結合することで、訓練ペア(x → y)を再構成するプロトタイプに基づく生成モデルを訓練する。
  • 訓練済みの生成モデルを用いて、希少なトークンや部分構造を含む出力を優先して合成訓練例をサンプリングする。
  • 希少または分布外のパターンを強調する高品質な合成例をフィルタリング・優先するため、再サンプリングを適用する。
  • 合成データセット上で標準的ニューラル系列モデルを微調整し、構成的一般化能力を抽出する。
  • 再結合中の構造的・意味的整合性を保つために、再構成損失を用いて生成モデルを最適化する。
  • 温度に基づくサンプリング戦略を用い、データ拡張中に希少で新規の部分構造の探索を促進する。

実験結果

リサーチクエスチョン

  • RQ1記号的構造を用いない状況でも、ニューラル系列モデルが少数ショット設定で体系的な構成的一般化を達成できるか?
  • RQ2既存の訓練例からデータを再結合・再サンプリングすることにより、学習された帰納的バイアスが訓練分布を超える一般化に十分であるか?
  • RQ3プロトタイプに基づく生成によるデータ拡張は、明示的な文法や規則系に依存する神経記号的手法を上回るか?
  • RQ4R&Rは、最小限の監視情報のもとで未観測の言語的構造への一般化をどの程度効果的に可能にするか?
  • RQ5再サンプリングは、希少現象の合成訓練例の品質と多様性にどのような影響を与えるか?

主な発見

  • R&RはSCANタスクにおける少数ショット構成的一般化を顕著に向上させ、わずか8例の訓練例からの複雑な命令の正確な予測を可能にする。
  • Sigmorphon 2018語彙素解析タスクでは、R&Rによりモデルが新たな屈折パターン(希少で未観測の時態を含む)を学習・一般化可能になる。
  • 最良のR&Rバージョン(recomb-1 + resampling)は、SCANおよびSigmorphon 2018の両タスクで最先端の性能を達成し、神経記号的ベースラインを上回る。
  • 再サンプリングにより合成例の品質が向上し、正しいおよび新規の屈折形の割合が増加する。
  • 本手法は記号的構造を一切必要とせず、データ再結合から帰納的バイアスが単独で生じることを示している。
  • 生成モデルの訓練、サンプリング、条件付きモデルの微調整を含むパイプライン全体の学習は、1つのGPUで1回の実験あたり1時間未塔である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。