Skip to main content
QUICK REVIEW

[論文レビュー] The Bottom-up Evolution of Representations in the Transformer: A Study with Machine Translation and Language Modeling Objectives

Elena Voita, Rico Sennrich|Zurich Open Repository and Archive (University of Zurich)|Sep 3, 2019
Topic Modeling参考文献 26被引用数 17
ひとこと要約

本稿は、機械翻訳(MT)、左から右への言語モデル(LM)、マスキング言語モデル(MLM)といった学習目的が、トランスフォーマーにおけるトークン表現の進化にどのように影響するかを調査する。偏相関分析(CCA)と相互情報量推定を用いて、LMレイヤーでは過去の文脈が徐々に失われながら将来の予測がなされるのに対し、MLMレイヤーではまずトークンの識別子を忘れて一般化し、上位レイヤーで再構築されることが明らかになった。これはMLMの優れた事前学習性能を説明する。

ABSTRACT

We seek to understand how the representations of individual tokens and the structure of the learned feature space evolve between layers in deep neural networks under different learning objectives. We focus on the Transformers for our analysis as they have been shown effective on various tasks, including machine translation (MT), standard left-to-right language models (LM) and masked language modeling (MLM). Previous work used black-box probing tasks to show that the representations learned by the Transformer differ significantly depending on the objective. In this work, we use canonical correlation analysis and mutual information estimators to study how information flows across Transformer layers and how this process depends on the choice of learning objective. For example, as you go from bottom to top layers, information about the past in left-to-right language models gets vanished and predictions about the future get formed. In contrast, for MLM, representations initially acquire information about the context around the token, partially forgetting the token identity and producing a more generalized token representation. The token identity then gets recreated at the top MLM layers.

研究の動機と目的

  • 異なる学習目的(MT、LM、MLM)が、トランスフォーマーの各レイヤーにおけるトークン表現の進化にどのように影響するかを理解すること。
  • 異なる目的(MT、LM、MLM)下でのレイヤー間の情報伝達ダイナミクスを調査すること。
  • 同じアーキテクチャのもとで、マスキング言語モデル(MLM)が左から右への言語モデル(LM)よりも事前学習で優れる理由を、表現の進化に基づいて説明すること。
  • 各レイヤーにおけるトークンの識別子、文脈、位置、構文の情報が、どのように保持・消失・獲得されるかを分析すること。

提案手法

  • 各レイヤーにおける表現に、トークン識別子と出力ラベルがどの程度保持されているかを測定するために、相互情報量推定を用いる。
  • 異なるトークンの表現間の影響度およびレイヤー間での表現変換の度合いを定量化するために、偏相関分析(CCA)を用いる。
  • 類似度に基づく分析を用いて、各表現における隣接トークン、位置、CCGスーパークラスタグの重要度を測定する。
  • モデルアーキテクチャとデータを同一に保ちつつ、MT、LM、MLMの3つの目的における表現の進化を比較する。
  • t-SNE可視化を適用し、CCGタグに基づくトークン表現(例:'is')の空間的再配置を、レイヤーごとに検証する。
  • バナジウム学習の観点から、表現における情報圧縮と予測のトレードオフを分析する。

実験結果

リサーチクエスチョン

  • RQ1異なる学習目的(MT、LM、MLM)下で、トークンの表現はレイヤーを経てどのように進化するか?
  • RQ2この進化過程で、どのような情報(例:トークン識別子、文脈、構文)が保持され、消失し、新たに獲得されるか?
  • RQ3同じアーキテクチャのもとで、マスキング言語モデル(MLM)が左から右への言語モデル(LM)よりも優れた事前学習性能を示す理由は何か?
  • RQ4トークン間の相互作用はレイヤーを経てどのように変化し、目的によってどのように異なるか?
  • RQ5異なる目的において、表現が過去の文脈と未来の文脈のどちらをどれほどに情報として保持しているかはどの程度か?

主な発見

  • 左から右への言語モデル(LM)では、下位レイヤーから上位レイヤーにかけて、過去の文脈情報が段階的に消失する一方で、表現は将来のトークン予測を強く反映するようになる。
  • マスキング言語モデル(MLM)では、初期段階でトークン識別子を忘れ、文脈情報を一般化して表現するが、上位レイヤーで再び識別子を再構築する。
  • 偏相関分析(CCA)の結果、MLMモデルの表現は顕著な変換を経験しており、特に初期レイヤーで文脈がエンコードされる段階で、レイヤー間の強い影響が観察される。
  • 隣接トークンの重要度は、MLMにおいて第2レイヤーまで上昇し、その後低下する。これは、文脈エンコードとトークン再構築の二段階的プロセスを示している。
  • CCGスーパークラスタグの重要度は、LMおよびMLMの両方で上位レイヤーで低下するが、そのパターンは異なる:LMでは過去の構文的構造が蓄積されるのに対し、MLMでは再構築の前段階で文脈に焦点が当たる。
  • t-SNE可視化により、同じ語(例:'is')の表現がCCGタグに基づいてレイヤーを経て再配置され、MLMとLMで明確に異なるクラスタリングパターンが形成されることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。