Skip to main content
QUICK REVIEW

[論文レビュー] Fusing finetuned models for better pretraining

Leshem Choshen, Elad Venezian|arXiv (Cornell University)|Apr 6, 2022
Machine Learning and Algorithms被引用数 12
ひとこと要約

この論文では、複数のファインチューニング済みモデルの重みを平均化することで、下流タスク向けの優れたベースモデルを構築する手法を提案する。この手法は、標準的な事前学習や相互学習を大きく上回り、計算コストを最小限に抑えつつ、多様なNLPベンチマークで高い精度と安定性を達成する。

ABSTRACT

Pretrained models are the standard starting point for training. This approach consistently outperforms the use of a random initialization. However, pretraining is a costly endeavour that few can undertake. In this paper, we create better base models at hardly any cost, by fusing multiple existing fine tuned models into one. Specifically, we fuse by averaging the weights of these models. We show that the fused model results surpass the pretrained model ones. We also show that fusing is often better than intertraining. We find that fusing is less dependent on the target task. Furthermore, weight decay nullifies intertraining effects but not those of fusing.

研究の動機と目的

  • 事前学習の高コストを軽減するため、学習を再び開始するのではなく、既存のファインチューニング済みモデルを再利用すること。
  • 追加の事前学習を伴わずに、下流タスク向けのベースモデルの品質を向上させること。
  • 複数のファインチューニング済みモデルを統合することで、単一モデルの相互学習に比べて優れた初期化が得られるかどうかを検証すること。
  • 重み減衰などのハイパーパrameterの選択に対する統合のロバストネスを評価すること。
  • 従来のトランスファーラーニングのパラダイムを逆転させ、ファインチューニング済みモデルを用いてより優れた事前学習モデルを構築すること。

提案手法

  • 統合は、複数のファインチューニング済みモデルの重みを平均化して新しいベースモデルを生成することとして定義される。
  • 統合モデルは $ W_{fuse} = \frac{1}{n} \sum_{i=1}^{n} W_i $ として初期化される。ここで $ W_i $ は $ i $ 番目のファインチューニング済みモデルの重みである。
  • 本手法は、多様なソースタスクからの既存のファインチューニング済みモデルを活用し、より優れた新しいベースモデルを初期化する。
  • 実験では、一般(GLUE/SuperGLUE)、NLI、Twitterの3つのファミリーにまたがる30のデータセットに対して、統合と標準的な事前学習および相互学習を比較する。
  • 重み減衰をファインチューニング段階で適用し、統合と相互学習のパフォーマンスに与える影響を評価する。
  • 性能とトレーニングの安定性を測るため、精度と標準偏差を用いて手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1複数のファインチューニング済みモデルを統合することで、標準的な事前学習よりも優れたベースモデルが得られるか?
  • RQ2同じソースモデルを用いた場合、統合は相互学習を一貫して上回るか?
  • RQ3重み減衰は、統合と相互学習のパフォーマンスにどのように影響するか?
  • RQ4統合は、ファインチューニング済みモデルのソースタスクやドメインの選択に対してロバストか?
  • RQ5多様なタスクからのモデルを統合することで、より汎用性の高いベースモデルが得られるか?

主な発見

  • T5において30のデータセットすべてで、ファインチューニング済みモデルの統合は標準的な事前学習を一貫して上回り、高い精度と低い分散を達成した。
  • 最良の2つのファインチューニング済みモデルを統合した場合、NLIで平均1.61%、Twitterで平均2.27%の精度向上を達成し、相互学習を上回った。
  • 統合モデルの標準偏差は、事前学習ベースのファインチューニングよりも一貫して低く、トレーニングの安定性が向上していることを示した。
  • 重み減衰は相互学習のパフォーマンスを著しく低下させたが、統合にはほとんど悪影響がなく、統合のロバストネスを示した。
  • 統合は特定のターゲットタスクへの依存が少なく、多様なNLPベンチマークにわたる強力な汎用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。