Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking embedding coupling in pre-trained language models

Hyung Won Chung, Thibault Févry|arXiv (Cornell University)|Oct 24, 2020
Topic Modeling参考文献 56被引用数 11
ひとこと要約

この論文は、事前学習言語モデルにおける入力埋め込みと出力埋め込みの結合という標準的手法に挑戦し、特に出力埋め込み次元を増大させることで、パラメータの増加なしにモデルの一般化性能と転移性能を向上させることを示している。保存されたパラメータをより深いTransformer層に再配分することで、より少ない事前学習トークンで多言語ベンチマークでSOTA性能を達成し、大きな出力埋め込みが過剰専門化を防ぎ、多言語的および多タスク的転移性を向上させることを実証した。

ABSTRACT

We re-evaluate the standard practice of sharing weights between input and output embeddings in state-of-the-art pre-trained language models. We show that decoupled embeddings provide increased modeling flexibility, allowing us to significantly improve the efficiency of parameter allocation in the input embedding of multilingual models. By reallocating the input embedding parameters in the Transformer layers, we achieve dramatically better performance on standard natural language understanding tasks with the same number of parameters during fine-tuning. We also show that allocating additional capacity to the output embedding provides benefits to the model that persist through the fine-tuning stage even though the output embedding is discarded after pre-training. Our analysis shows that larger output embeddings prevent the model's last layers from overspecializing to the pre-training task and encourage Transformer representations to be more general and more transferable to other tasks and languages. Harnessing these findings, we are able to train models that achieve strong performance on the XTREME benchmark without increasing the number of parameters at the fine-tuning stage.

研究の動機と目的

  • 事前学習言語モデルにおける入力と出力埋め込みの結合という広く普及した手法を、特に多言語設定において再評価すること。
  • 埋め込み次元を分離することで、モデルの柔軟性、パラメータ効率、および下流タスクのパフォーマンスが向上するかどうかを調査すること。
  • 出力埋め込みサイズを増大させることで、タスクおよび言語をまたいで表現の一般化と転移性が向上するかどうかを特定すること。
  • mBERTと同等のファインチューニングパラメータ数で、より少ない事前学習トークンでXLM-Rを上回る性能を示す、再バランス化された多言語BERT(RemBERT)の設計と評価を行うこと。

提案手法

  • エンコーダーのみのモデルにおいて、入力と出力埋め込み次元を分離し、それぞれを独立して最適化可能にする。
  • 保存されたパラメータを活用して、入力埋め込み次元を安全に縮小し、Transformer層の幅と深さを増やす。
  • 事前学習後に破棄されるにもかかわらず、出力埋め込み次元を入力次元を超えて拡大することで、事前学習信号と表現品質を向上させる。
  • 同じファインチューニングパラメータ数でmBERTと同等の設定を使用し、最適化された埋め込み割り当てを用いて再バランス化されたmBERT(RemBERT)モデルを訓練する。
  • Tenneyら(2019)のプロービング分析を混合戦略(mix strategy)で用い、POS、SRL、コアリファレンスを含む9つのタスクにおける一般NLP能力を評価する。
  • 英語からドイツ語への最近傍法翻訳精度を段階的に測定することで、言語に依存しない表現学習の度合いを評価する。

実験結果

リサーチクエスチョン

  • RQ1入力と出力埋め込み次元を分離することで、多言語的事前学習モデルの下流タスクパフォーマンスが向上するか?
  • RQ2事前学習後に破棄されるにもかかわらず、出力埋め込みサイズを増大させることで、モデルの一般化と転移性が向上するか?
  • RQ3より大きな出力埋め込みが、最後のTransformer層が事前学習タスクに過剰に特化するのをどの程度防ぐか?
  • RQ4埋め込みの分離が、多言語モデルにおける言語間アライメントと転移性にどのように影響するか?
  • RQ5埋め込み分離によるパラメータ配分最適化により、より少ない事前学習トークンでXLM-Rなどの強力なベースラインを上回るモデルを構築できるか?

主な発見

  • 出力埋め込み次元を128から3072に増大させることで、9つのNLPタスクすべてでプロービング精度が向上し、ファインチューニングパラメータを増加させずに平均0.5ポイントの向上を達成した。
  • 再バランス化されたmBERT(RemBERT)モデルは、XLM-RをXTREMEベンチマークで上回り、事前学習に使用したトークン数を3.5倍も削減した。
  • より大きな出力埋め込みは、上位のTransformer層において平坦で言語に依存しない表現を生み出し、英語からドイツ語への最近傍法翻訳精度の向上によって実証された。
  • 大きな出力埋め込みによるパフォーマンス向上はファインチューニング後も持続し、事前学習の質が下流タスクへの転移性に直接影響していることを示した。
  • 埋め込み次元の分離により、性能に損なわれることなく入力埋め込みを安全に縮小でき、その分のパラメータをより深い・広いTransformer層に再配分できた。
  • プロービング結果から、より大きな出力埋め込みは、特に上位層において、事前学習目的への過剰専門化を軽減することで、モデルの一般NLP能力を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。