Skip to main content
QUICK REVIEW

[論文レビュー] What they do when in doubt: a study of inductive biases in seq2seq learners

Eugene Kharitonov, Rahma Chaabouni|arXiv (Cornell University)|Jun 26, 2020
Domain Adaptation and Few-Shot Learning参考文献 41被引用数 13
ひとこと要約

本稿は、記憶、算術、階層的、構成的推論を調べる4つの合成タスクを用いて、seq2seqモデルにおける誘導的バイアスを調査する。記述長を、原理的で感受性の高い誘導的バイアスの測定法として導入し、LSTMおよびTransformerモデルが階層的一般化を好むのに対し、CNNベースのモデルは線形的かつ構成的パターンを好むことが判明。特にTransformerは強い記憶バイアスを示す。

ABSTRACT

Sequence-to-sequence (seq2seq) learners are widely used, but we still have only limited knowledge about what inductive biases shape the way they generalize. We address that by investigating how popular seq2seq learners generalize in tasks that have high ambiguity in the training data. We use SCAN and three new tasks to study learners' preferences for memorization, arithmetic, hierarchical, and compositional reasoning. Further, we connect to Solomonoff's theory of induction and propose to use description length as a principled and sensitive measure of inductive biases. In our experimental study, we find that LSTM-based learners can learn to perform counting, addition, and multiplication by a constant from a single training example. Furthermore, Transformer and LSTM-based learners show a bias toward the hierarchical induction over the linear one, while CNN-based learners prefer the opposite. On the SCAN dataset, we find that CNN-based, and, to a lesser degree, Transformer- and LSTM-based learners have a preference for compositional generalization over memorization. Finally, across all our experiments, description length proved to be a sensitive measure of inductive biases.

研究の動機と目的

  • データが限られた状況下で、複数の説明が限られた訓練データと整合する場合に、seq2seqモデルがどのように一般化するかを理解すること。
  • 一般的なseq2seqアーキテクチャにおいて、記憶、算術、階層、構成的推論などの誘導的バイアスを特定・定量化すること。
  • ソロモンoffの誘導理論に基づき、記述長(L)を用いて原理的で感受性の高い誘導的バイアスの測定法を提案・検証すること。
  • LSTM、Transformer、CNNベースのseq2seqモデルが、多様な推論パターンにおいてどのように一般化行動を示すかを比較すること。

提案手法

  • 記憶と同定が困難な訓練データを備えた4つの新しい合成タスクを設計:Count-or-Memorization、Add-or-Multiply、Hierarchical-or-Linear、Composition-or-Memorization。各タスクは明確な一般化パターンを有する。
  • モデルが特定のルールに従って一般化する頻度を測るため、完全一致率(FPA)を用いる。FPAが高いほど、そのルールへのバイアスが強いことを示す。
  • 誘導的バイアスの原理的測定法として、記述長(L)を提案。これは、与えられたルール下でのモデルの予測の記述長であり、値が低いほど強いバイアスを示す。
  • 例数で記述長を正規化し、学習速度とバイアス獲得の履歴を追跡可能とし、バイアスの進化を分析可能にする。
  • 20個のランダムシードを用いて、各タスクでLSTM、Transformer、CNNの複数のモデルを学習し、アーキテクチャや設定間でのFPAおよび記述長を比較する。
  • 候補となるルール間の記述長の差の統計的有意性を検証するため、対応t検定を適用する。

実験結果

リサーチクエスチョン

  • RQ1高次元の曖昧性を持つタスクで1つの例のみで学習したseq2seqモデルは、どのように一般化するか?
  • RQ2LSTM、Transformer、CNNベースのseq2seqモデルは、記憶、算術、階層的、構成的推論のどの誘導的バイアスを示すか?
  • RQ3記述長は、seq2seqモデルにおける誘導的バイアスを感受性の高い原理的測定法として用いることができるか?
  • RQ4異なるアーキテクチャは、ある種の一般化を他のものよりも速く学習するか?

主な発見

  • LSTMベースのモデルは、1つの訓練例からでも、数え上げ、加算、定数倍乗算といった非自明な算術ルールを学習できる。
  • TransformerおよびLSTMベースのモデルは、線形一般化よりも階層的一般化を強く好むが、CNNベースのモデルは逆に線形一般化を好む。
  • 十分な合成例が与えられた場合、CNNベースのモデルは、記述長が低いことから、記憶よりも構成的一般化を好むバイアスを示す。
  • Transformerは、記憶バイアスが顕著で、記述長が構成的ルールよりも記憶ルールで著しく低くなる。
  • 記述長は、モデルタイプや一般化ルールの違いにおいて、統計的に有意な差を示し、感受性と信頼性の両方を兼ね備えた誘導的バイアスの測定法であることが実証された。
  • ソース・ターゲットの自己注意を統合したモデルの誘導的バイアスは、標準的なTransformerと類似しており、注意メカニズムの違いにかかわらず一貫性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。