Skip to main content
QUICK REVIEW

[論文レビュー] On the Transformer Growth for Progressive BERT Training

Xiaotao Gu, Liyuan Liu|arXiv (Cornell University)|Oct 23, 2020
Topic Modeling参考文献 28被引用数 4
ひとこと要約

本稿では、深さ、幅、入力系列長の3つの次元を同時に最適化された成長作用素を用いて段階的BERT事前学習において変形可能なTransformerモデルを拡大する手法CompoundGrowを提案する。複数の次元をバランスさせ、効果的な作用素(長さの場合は埋め込みプーリング、幅の場合はパラメータ共有)を選択することで、BERT-baseとBERT-largeの事前学習をそれぞれ壁時計時間で73.6%、82.2%高速化し、元のBERT性能と同等またはそれを上回る。

ABSTRACT

Due to the excessive cost of large-scale language model pre-training, considerable efforts have been made to train BERT progressively -- start from an inferior but low-cost model and gradually grow the model to increase the computational complexity. Our objective is to advance the understanding of Transformer growth and discover principles that guide progressive training. First, we find that similar to network architecture search, Transformer growth also favors compound scaling. Specifically, while existing methods only conduct network growth in a single dimension, we observe that it is beneficial to use compound growth operators and balance multiple dimensions (e.g., depth, width, and input length of the model). Moreover, we explore alternative growth operators in each dimension via controlled comparison to give operator selection practical guidance. In light of our analyses, the proposed method speeds up BERT pre-training by 73.6% and 82.2% for the base and large models respectively, while achieving comparable performances

研究の動機と目的

  • 段階的事前学習におけるTransformer成長の理解を深めること、特に多次元スケーリングの役割を明らかにすること。
  • BERTモデルにおける深さ、幅、入力長の各次元に対して効果的な成長作用素を同定すること。
  • 効率的な複合的成長戦略を用いて大規模BERT事前学習の高い計算コストを低減すること。
  • 段階的学習における成長作用素の実証的ガイドラインに基づく実用的設計原則を提供すること。

提案手法

  • 深さ、幅、入力系列長をバランスよく同時にスケーリングする複合的成長作用素を提案する。
  • 長さの次元において、長系列の直接切断に代わってサイズ2の埋め込みプーリングを適用する。
  • 前駆動ネットワークにk=2のパラメータ共有を適用し、完全な再初期化なしに幅を効率的に拡大する。
  • 小さなモデルからスタッキングを用いて深さを成長させ、学習済み重みを保持する。
  • 成長作用素の比較のため、制御されたアブレーションスタディを実施し、低ランク近似やプーリングを含む各次元の作用素を検証する。
  • 3段階の訓練スケジュールを実装する:部分的容量で小さなモデルを学習し、その後、完全容量への複合的成長を適用し、最後に完全なファインチューニングを行う。

実験結果

リサーチクエスチョン

  • RQ1深さ、幅、入力長の複数のモデル次元における複合的スケーリングは、BERTにおける単一次元的成長と比較して、より優れた性能とより速い学習をもたらすか?
  • RQ2長さの次元ではプーリングと切断、幅の次元ではパラメータ共有と低ランク近似のうち、どの成長作用素が最も効果的か?
  • RQ3複合的成長は、標準的なBERT事前学習と同等またはそれ以上の性能を達成しながら、著しく訓練時間を短縮できるか?
  • RQ4成長作用素の選択が、訓練の安定性および下流タスクにおける最終的なファインチューニング性能に与える影響はいかほどか?

主な発見

  • CompoundGrowは、標準的な訓練と比較して、BERT-baseの事前学習の壁時計時間を73.6%、BERT-largeでは82.2%短縮し、性能の低下は認められない。
  • GLUEベンチマークでは標準BERTと同等またはそれ以上の性能を達成しており、CoLAではわずかな低下が見られるが、これはデータセットサイズとばらつきによる可能性が大きい。
  • 長さの成長において、埋め込みプーリングは直接切断を上回り、一般化性能と訓練の安定性を向上させる。
  • 幅のスケーリングにおいて、パラメータ共有は低ランク近似を上回り、モデル容量と性能を保持する。
  • 深さ、幅、入力長の複合的スケーリングは、単一次元的成長と比較して優れた結果をもたらし、段階的学習における複合効果を裏付ける。
  • 最終モデルはMNLIおよびSQuaDベンチマークで標準BERTの性能と同等またはそれを上回り、複合的成長戦略の有効性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。