Skip to main content
QUICK REVIEW

[論文レビュー] bert2BERT: Towards Reusable Pretrained Language Models

Cheng Chen, Yichun Yin|arXiv (Cornell University)|Oct 14, 2021
Topic Modeling被引用数 6
ひとこと要約

本稿では、BERT2BERTを提案する。これは、高度なパラメータ初期化と二段階の訓練戦略を用いて、小規模な事前学習済みモデルからの知識を再利用することで、大規模言語モデルの事前学習を高速化する手法である。特に、小規模モデルからの知識を用いて大規模モデルを初期化する(高度な知識初期化(AKI)および関数保存初期化(FPI)を用いる)ことで、GPTでは最大47%、BERTでは最大45%の事前学習計算量を削減する。このアプローチにより、多様なアーキテクチャにおいて顕著な効率性向上が実証された。

ABSTRACT

In recent years, researchers tend to pre-train ever-larger language models to explore the upper limit of deep models. However, large language model pre-training costs intensive computational resources and most of the models are trained from scratch without reusing the existing pre-trained models, which is wasteful. In this paper, we propose bert2BERT, which can effectively transfer the knowledge of an existing smaller pre-trained model (e.g., BERT_BASE) to a large model (e.g., BERT_LARGE) through parameter initialization and significantly improve the pre-training efficiency of the large model. Specifically, we extend the previous function-preserving on Transformer-based language model, and further improve it by proposing advanced knowledge for large model's initialization. In addition, a two-stage pre-training method is proposed to further accelerate the training process. We did extensive experiments on representative PLMs (e.g., BERT and GPT) and demonstrate that (1) our method can save a significant amount of training cost compared with baselines including learning from scratch, StackBERT and MSLT; (2) our method is generic and applicable to different types of pre-trained models. In particular, bert2BERT saves about 45% and 47% computational cost of pre-training BERT_BASE and GPT_BASE by reusing the models of almost their half sizes. The source code will be publicly available upon publication.

研究の動機と目的

  • 大規模言語モデルの事前学習にかかる高い計算コストと炭素排出量を低減すること。
  • 学習から再び開始するのではなく、事前に学習済みの小規模モデルからの知識を再利用することで、効率的な事前学習を探索すること。
  • BERT や GPT などの多様なトランスフォーマー基盤の事前学習済みモデルに適用可能な汎用的かつモデルに依存しない手法を開発すること。
  • パラメータ初期化と二段階の事前学習戦略を通じて、訓練効率を向上させること。

提案手法

  • Chen ら(2016)の関数保存初期化(FPI)を、トランスフォーマー基盤の言語モデルに拡張し、初期化段階で大規模モデルが小規模モデルと同様に振る舞うことを保証する。
  • 高度な知識初期化(AKI)を提案する。これは、小規模モデルの異なる層の重みを複製・積み重ねることで、収束を加速するが、わずかに関数保存の原則を違反する可能性がある。
  • さらに最適化を高速化するため、二段階の事前学習戦略を採用する。
  • 小規模な事前学習済みモデル(例:D=512 の BERT BASE)を用いて、大規模なターゲットモデル(例:D=768 の BERT LARGE)をパラメータの複製と積み重ねによって初期化する。
  • この手法を BERT および GPT の両方のアーキテクチャに適用し、異なるモデルタイプや正規化方式(例:ポスト-LN 対 プレ-LN)に対しても汎用的な適用性を実証する。
  • 初期化済みの大規模モデルに対して、標準的な事前学習目的(マスク言語モデリングおよび次文予測)を用い、微調整されたハイパーパrameterを適用することで、より速い収束を達成する。

実験結果

リサーチクエスチョン

  • RQ1小規模な事前学習済みモデルからの知識が、大規模モデルの初期化に効果的に転送可能であり、事前学習コストを削減できるか?
  • RQ2高度な知識初期化(AKI)は、標準的な関数保存初期化よりも、大規模モデルの事前学習における収束を加速するか?
  • RQ3提案手法が、BERT や GPT などの異なるアーキテクチャにおいて、どの程度計算コストを削減できるか?
  • RQ4この手法は、異なる正規化方式(例:ポスト-LN 対 プレ-LN)を備えた多様な事前学習済みモデルに適用可能であり、汎用性があるか?
  • RQ5二段階の事前学習戦略は、初期化された重みからエンドツーエンドで学習するのと比較して、訓練効率をどのように向上させるか?

主な発見

  • BERT BASE では、サイズがおよそ半分の小規模モデルからの初期化により、事前学習の計算コストを45%削減する。GPT BASE では47%の削減が達成された。
  • この手法は、BERT(ポスト-LN)および GPT(プレ-LN)といった異なるモデルアーキテクチャにおいて顕著な効率性向上を示しており、汎用的な適用性を実証した。
  • 関数保存の原則をわずかに違反するが、高度な知識初期化(AKI)は、標準的な関数保存初期化よりも収束が速い。
  • 二段階の事前学習戦略により、さらに訓練が高速化され、全体的な効率向上に寄与した。
  • StackBERT や MSLT といったベースライン手法よりも、計算コストの削減において優れた性能を示したが、下流タスクにおける性能は競争力のある水準を維持した。
  • 実験結果から、小規模モデルと大規模モデルの注意パターンが非常に類似していることが示され、異なるサイズのモデル間での知識転送の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。