Skip to main content
QUICK REVIEW

[論文レビュー] Efficient pre-training objectives for Transformers

Luca Di Liello, Matteo Gabburo|arXiv (Cornell University)|Apr 20, 2021
Topic Modeling参考文献 18被引用数 4
ひとこと要約

この論文は、マスクされた言語モデリング(MLM)の代わりに、ELECTRAにインspiredされた判別的アプローチを用い、より単純なジェネレータと全出力損失計算を導入することで、Transformerモデルの効率的な事前学習目的を提案する。主な貢献は、マスクされたトークンを排除し、ジェネレータを単純化することで計算コストとメモリ使用量を削減しながらも、BERTやELECTRAと同等またはそれ以上の性能を達成すること、特に転移学習において顕著である。

ABSTRACT

The Transformer architecture deeply changed the natural language processing, outperforming all previous state-of-the-art models. However, well-known Transformer models like BERT, RoBERTa, and GPT-2 require a huge compute budget to create a high quality contextualised representation. In this paper, we study several efficient pre-training objectives for Transformers-based models. By testing these objectives on different tasks, we determine which of the ELECTRA model's new features is the most relevant. We confirm that Transformers pre-training is improved when the input does not contain masked tokens and that the usage of the whole output to compute the loss reduces training time. Moreover, inspired by ELECTRA, we study a model composed of two blocks; a discriminator and a simple generator based on a statistical model with no impact on the computational performances. Besides, we prove that eliminating the MASK token and considering the whole output during the loss computation are essential choices to improve performance. Furthermore, we show that it is possible to efficiently train BERT-like models using a discriminative approach as in ELECTRA but without a complex generator, which is expensive. Finally, we show that ELECTRA benefits heavily from a state-of-the-art hyper-parameters search.

研究の動機と目的

  • BERTに類似したモデルの事前学習における高い計算コストを、性能に損なわれることなく低減すること。
  • マスクトークン(MASK)を除去することで、一般化性能と学習効率が向上するかを調査すること。
  • 計算オーバーヘッドを最小限に抑えつつモデル品質を維持できる軽量で効率的なジェネレータの設計。
  • 全出力シーケンスの損失計算が、学習速度とモデル性能に与える影響を評価すること。
  • ELECTRAに類似した判別的アプローチが、より単純な構成を用いてもMLMを上回る可能性があるかを検証すること。

提案手法

  • 標準的なMLM目的の代わりに、各トークンが元のものか置換済みかを分類する「トークン検出(TD)」タスクを導入する。
  • トークンの置換に、ランダム選択または履歴に基づく統計的カウントを用いた簡素化されたジェネレータを採用し、複雑さを低減する。
  • 判別器の全出力に対して全シーケンス損失を適用し、学習効率と収束性を向上させる。
  • ベースラインと同一のハイパーパrameterとデータセットを用いて、RoBERTaベースのモデルを、新しい目的(SLM, RTS, C-RTS)で学習する。
  • 履歴ベースジェネレータにおけるスパarsityを軽減するため、レアトークンをクラスタリングする。
  • 低リソースタスク(例:ASNQ-R)から微調整したモデルを高リソースタスク(例:WikiQA)に転移して、一般化性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1事前学習からMASKトークンを除去することで、特に転移学習においてモデル性能と一般化性能が向上するか?
  • RQ2ELECTRAの複雑なジェネレータに代えて、単純な統計的ジェネレータが性能を劣化させずに代替可能か?
  • RQ3全出力シーケンスの損失計算により、学習時間の短縮と効率の向上が達成されるか?
  • RQ4提案された目的(SLM, RTS, C-RTS)は、MLMやELECTRAと比較して、正確性と計算コストの面でどのように差がつくか?
  • RQ5ハイパーパrameterチューニングの影響が、判別的事前学習目的の性能にどの程度及ぶか?

主な発見

  • MASKを含まないSLM目的を用いたRoBERTaモデルは、GLUE、SQUAD、WikiQA、ASNQ-Rのすべてのベンチマークで、RoBERTa-MLMを一貫して上回る性能を示した。
  • モデル履歴に基づくより難しい置換を用いるRoBERTa-C-RTSモデルは、MLMおよびRTSと比較して、特に低リソースタスク(WikiQA)において優れた転移学習性能を達成した。
  • ELECTRAのSLM-allバージョンは、SQUAD(79.0 vs. 79.3 MAP)でELECTRAと同等の性能を示し、転移学習後のWikiQAでは(87.4 vs. 86.9 MRR)を上回った。
  • より単純なジェネレータと全出力損失のため、提案手法はELECTRAよりも分類ヘッドが小さく、計算リソースも少なくて済む。
  • RoBERTa-RTSおよびRoBERTa-C-RTSモデルは、RoBERTa-MLMと同等の性能を達成しながら、学習時間の短縮と低メモリ使用量を実現した。
  • ELECTRAの性能はハイパーパrameterチューニングに極めて敏感であり、SLM-allのような単純な構成を用いる際にはその利点が著しく低下した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。