[論文レビュー] Transformers Generalize Linearly
この論文は、構文的シーケンス・ツー・シーケンスタスクにおいて、訓練データが線形パターンと階層的パターンの両方と一貫している場合に、Transformersが階層的一般化へのインダクティブバイアスを示すかを調査している。分布内データでは優れた性能を示すが、階層的構造を要する分布外一般化タスクでは一貫して失敗し、線形一般化への顕著な好みを示す。これは、再帰的ネットワークでさえもこのバイアスで上回る。
Natural language exhibits patterns of hierarchically governed dependencies, in which relations between words are sensitive to syntactic structure rather than linear ordering. While re-current network models often fail to generalize in a hierarchically sensitive way (McCoy et al.,2020) when trained on ambiguous data, the improvement in performance of newer Trans-former language models (Vaswani et al., 2017)on a range of syntactic benchmarks trained on large data sets (Goldberg, 2019; Warstadtet al., 2019) opens the question of whether these models might exhibit hierarchical generalization in the face of impoverished data.In this paper we examine patterns of structural generalization for Transformer sequence-to-sequence models and find that not only do Transformers fail to generalize hierarchically across a wide variety of grammatical mapping tasks, but they exhibit an even stronger preference for linear generalization than comparable recurrent networks
研究の動機と目的
- Transformersが構文的シーケンス・ツー・シーケンスタスクにおいて階層的一般化へのインダクティブバイアスを示すかどうかを特定すること。
- 同一で曖昧な訓練データを用いた場合、Transformersと再帰的ネットワーク(LSTMs、GRUs)の一般化行動を比較すること。
- 構文ベンチマークで達成された成功が、アーキテクチャ上のインダクティブバイアスによるものか、大規模な訓練データへの露出によるものかを評価すること。
- 線形一般化と階層一般化のパターンを区別できるようにした分布外テストセットにおける一般化を評価すること。
- 観察されたTransformersの構文的成功が、アーキテクチャ上のインダクティブバイアスか、データ駆動型のパターン学習によるものかを調査すること。
提案手法
- 線形一般化と階層一般化の両方が可能な曖昧な訓練データを備えた4つの英語トランスダクションタスクを設計した。
- 分布内テストセットと分布外一般化(gen)セットを作成し、線形一般化と階層一般化のパターンを区別できるようにした。
- 同じデータ上で、4ヘッド、3層、128次元のTransformersモデルと、注意機構付き(加法的/乗法的)および無しの再帰的モデル(LSTMs、GRUs)を訓練した。
- 再帰的モデルには、1層、隠れ層および埋め込み空間が256次元で、各モデルタイプごとに10回のランダム重み初期化を実施した。
- 10回の実行における中央値精度を用いてモデルを評価し、全シーケンス精度や重要な要素(例:否定マーカー、反射代名詞の先行詞)の配置を焦点とした指標を用いた。
- 予測結果を反射代名詞線形型、主語線形型、階層型に分類し、照応関係タスクにおける一般化戦略を評価した。
実験結果
リサーチクエスチョン
- RQ1訓練データが線形パターンと階層的パターンの両方と一貫している場合に、Transformersアーキテクチャは階層的一般化へのバイアスを示すか?
- RQ2分布外構文一般化タスクにおいて、Transformersの一般化性能は再帰的ネットワーク(LSTMs、GRUs)と比べてどうか?
- RQ3Transformersが構文ベンチマークで成功を収めているのは、アーキテクチャ上のインダクティブバイアスによるものか、大規模な訓練データへの露出によるものか、その程度はいかほどか?
- RQ4線形パターンが訓練データと一貫しているにもかかわらず、曖昧なデータで学習したモデルは、階層的構造への一般化を正しく行えるか?
- RQ5異なるニューラルアーキテクチャにおいて、線形一般化と階層一般化の好みの相対的な強さはどの程度か?
主な発見
- Transformersは、すべてのタスクにおいて分布内テストセットでほぼ限界性能を達成しており、訓練データからの強力なパターン学習が示された。
- 分布外一般化セットでは、Transformersは一貫して失敗し、階層一般化を要するタスク(例:neg-main、反射代名詞照応)ではほぼゼロの精度を示した。
- すべてのモデル、包括的にTransformersを含め、線形一般化戦略(例:neg-first、reflexive-linear)を顕著に好む傾向があり、これは階層パターンが唯一一貫した一般化であるにもかかわらずである。
- LSTMsは、反射代名詞照忡タスクにおいて最高の中央値階層性能(65.8%)を示し、TransformersやGRUsを上回った。
- 線形一般化への好みは、すべてのタスクおよびモデルタイプで一貫しており、Transformersは線形パターンへのバイアスが最も強い。
- 結果から、Transformersが構文ベンチマークで成功を収めているのは、階層的構造への本質的インダクティブバイアスによるものではなく、大規模コーパスからのデータ駆動型パターン学習によるものであると示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。