Skip to main content
QUICK REVIEW

[論文レビュー] Learning compositionally through attentive guidance

Dieuwke Hupkes, Anand Singh|arXiv (Cornell University)|May 20, 2018
Domain Adaptation and Few-Shot Learning参考文献 32被引用数 19
ひとこと要約

本稿では、学習時に注意機構を用いて構成的入力コンポonentに注目させることで、構造的で一般化可能な解を学習可能にする、訓練時損失であるAttentive Guidance (AG) を提案する。AGは、アーキテクチャの変更なしに、seq2seqモデルが体系的で一般化可能な解を学習できるようにする。AGは、照合テーブルタスクおよび記号置換タスクにおいて、構成的一般化性能を顕著に向上させ、訓練パターンに過適合するvanillaモデルを上回る性能を示す。

ABSTRACT

While neural network models have been successfully applied to domains that require substantial generalisation skills, recent studies have implied that they struggle when solving the task they are trained on requires inferring its underlying compositional structure. In this paper, we introduce Attentive Guidance, a mechanism to direct a sequence to sequence model equipped with attention to find more compositional solutions. We test it on two tasks, devised precisely to assess the compositional capabilities of neural models, and we show that vanilla sequence to sequence models with attention overfit the training distribution, while the guided versions come up with compositional solutions that fit the training and testing distributions almost equally well. Moreover, the learned solutions generalise even in cases where the training and testing distributions strongly diverge. In this way, we demonstrate that sequence to sequence models are capable of finding compositional solutions without requiring extra components. These results helps to disentangle the causes for the lack of systematic compositionality in neural networks, which can in turn fuel future work.

研究の動機と目的

  • 勾配降下法で学習される標準的なseq2seqモデルに、体系的構成性の欠如を是正すること。
  • アーキテクチャの強化なしに、vanilla RNNにおける注意機構が、構成的解へと誘導可能かどうかを調査すること。
  • 補助的監視信号としてのAttentive Guidanceが、入力シーケンス内の意味的で再利用可能な部分成分に注目させることをテストすること。
  • このような誘導が、分布シフト下でも、特に長時間または未観測の構成に対して、より良い一般化をもたらすかどうかを評価すること。
  • ニューラルモデルにおける構成性の欠如が、注意機構が顕著なパターンと誤ったパターンを区別できないことによるものかどうかを解明すること。

提案手法

  • 訓練中に注目すべき特定の意味的入力トークンを、出力トークンごとに目標となる注目パターンとして提供する微分可能損失項を導入する。
  • 構成的一般化をテストするために、特に設計された照合テーブルタスクおよび記号置換タスクにこの誘導信号を適用する。
  • LSTM/GRUエンコーダとデコーダを用いた標準的なseq2seqモデルを、標準的なドット積注意機構と組み合わせ、AG損失を用いて訓練し、注目ダイナミクスを形状づける。
  • アブレーションスタディにおいて、Gumbel-Softmaxを用いて注目重みのスパarsityを強制し、スパarsityそのものがAGの利点を再現できるかをテストする。
  • 長時間シーケンスおよび分布外テストセットにおける一般化性能を評価し、耐性を測定する。
  • インファレンス時に完全な注目ターゲットを提供するオラクル誘導を用い、性能の上限をテストし、注目パターンの一般化が核心的ボトルネックであるかどうかを評価する。

実験結果

リサーチクエスチョン

  • RQ1単純な微分可能損失項が、アーキテクチャの変更なしに、seq2seqモデルの注目をより構成的解へと誘導できるか?
  • RQ2テストデータが学習データと乖離する際、Attentive Guidanceが構成的タスクにおける一般化性能を向上させるか?
  • RQ3AGの成功は注目重みのスパarsityに起因するのか、それとも誘導信号の特定の構造が本質的か?
  • RQ4モデルが長時間構成に対して一般化できない原因が、正しい注目パターンを学習できないことによるものである程度はどの程度か?
  • RQ5完全な注目ターゲットを提供することで、訓練とテストの性能ギャップを埋められるか? これにより、注目パターン学習が主なボトルネックであると示唆されるか?

主な発見

  • 注意機構を備えたvanilla seq2seqモデルは、学習分布に過適合し、特に分布シフト下で、未観測の構成には一般化に失敗する。
  • Attentive Guidanceで訓練されたモデルは、注目ヒートマップで示されるように、関連する入力コンポーネントに鋭く集中した注目パターンを学習し、学習分布およびテスト分布の両方で堅牢に一般化する。
  • 誘導付きモデルは、学習中に観測しなかった長時間の構成に対しても、照合テーブルタスクおよび記号置換タスクでほぼ完璧な性能を達成する。
  • Gumbel-Softmaxを用いたアブレーションでは、注目重みのスパarsityを強制してもAGの性能向上を再現できないため、特定の誘導信号そのもの——単なるスパarsityではない——が重要であると示唆される。
  • オラクル誘導(インファレンス時に完全な注目パターンを提供)は、非常に長いシーケンスに対しても、両タスクでほぼ100%の正確性を達成する。これは、注目パターンの一般化が主な障害要因であることを示唆する。
  • 結果から、適切な目的関数によって誘導されれば、標準的なseq2seqモデルが構成的解を学習可能であることが確認され、このようなモデルにおける構成性の欠如は、注意機構が顕著なパターンと誤ったパターンを区別できないことによるものであると示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。