Skip to main content
QUICK REVIEW

[論文レビュー] Reusing Pretrained Models by Multi-linear Operators for Efficient Training

Yu Pan, Ye Yuan|arXiv (Cornell University)|Oct 16, 2023
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、小規模な事前学習モデルから大規模なターゲットモデルへの重みの完全マッピングを可能にする多線形演算子Mangoを提案する。Mangoは、ネットワーク全体にわたる重み間の相関関係(内部および相互)を捉える。大規模なマッピングテンソルをテンソルリング構造を用いて分解することで、計算コストとメモリコストを削減し、DeiT-baseへの転移において76%低いFLOPsを達成。また、訓練効率においてbert2BERTおよびLiGOをそれぞれ12.0%および20.7%上回る。

ABSTRACT

Training large models from scratch usually costs a substantial amount of resources. Towards this problem, recent studies such as bert2BERT and LiGO have reused small pretrained models to initialize a large model (termed the ``target model''), leading to a considerable acceleration in training. Despite the successes of these previous studies, they grew pretrained models by mapping partial weights only, ignoring potential correlations across the entire model. As we show in this paper, there are inter- and intra-interactions among the weights of both the pretrained and the target models. As a result, the partial mapping may not capture the complete information and lead to inadequate growth. In this paper, we propose a method that linearly correlates each weight of the target model to all the weights of the pretrained model to further enhance acceleration ability. We utilize multi-linear operators to reduce computational and spacial complexity, enabling acceptable resource requirements. Experiments demonstrate that our method can save 76\% computational costs on DeiT-base transferred from DeiT-small, which outperforms bert2BERT by +12.0\% and LiGO by +20.7\%, respectively.

研究の動機と目的

  • 既存のモデル distillation および成長手法における部分的重みマッピングの非効率性を解消すること。
  • 全モデルにわたる重み間の相互および内部相関関係を活用し、初期化の質を向上させること。
  • 小規模モデルと大規模モデル間の完全マッピングに伴う計算コストおよびメモリコストを低減すること。
  • 事前学習済みの小規模モデルを用いて大規模なTransformerの訓練をより速く、より効率的に行えるようにすること。
  • リソース消費と二酸化炭素排出量を最小限に抑えることで、Green AI を支援すること。

提案手法

  • 部分的またはレイヤー特化的なマッピングではなく、ターゲットモデルの各重みを事前学習済みモデルのすべての重みと関連付ける完全マッピング戦略を提案すること。
  • テンソルリング分解に基づく多線形演算子Mangoを導入し、空間的および計算的コストを削減して大規模な完全マッピングテンソルを効率的に表現すること。
  • 4つの低ランクテンソルをランクで結合することで、完全マッピングを近似し、スケーラブルで学習可能なパrameterizationを実現すること。
  • ターゲットモデルと同時にエンドツーエンドでMango演算子を学習させることで、小規模モデルから大規模モデルへの最適な変換を学習可能にすること。
  • 視覚(DeiT)、自然言語処理(BERT)、言語モデル(GPT)に本手法を適用し、アーキテクチャを越えた一般化を示すこと。
  • 評価のため、AdamW、初期学習率1e-4、重み減衰1e-2、バッチサイズ512の標準的な訓練プロトコルを用いること。

実験結果

リサーチクエスチョン

  • RQ1すべてのモデルパラメータにわたる完全な重みマッピングは、部分的重みマッピングと比較して訓練効率を向上させるか?
  • RQ2Mangoのような多線形演算子は、性能を損なわずに完全マッピングテンソルを効果的に圧縮できるか?
  • RQ3モデル全体にわたる重み間の相互および内部相関関係を活用することで、収束が速まり、精度が向上するか?
  • RQ4FLOPsおよび訓練速度の観点で、bert2BERT や LiGO といった最先端手法と比較して、本手法はどのように差をつけるか?
  • RQ5MangoはViT、BERT、GPTといった異なるアーキテクチャに一般化可能か?

主な発見

  • DeiT-smallからDeiT-baseに転移する際、MangoはFLOPsを76%削減し、ベースライン手法を著しく上回る。
  • GLUEベンチマークでは、Mangoは平均90.60%の精度を達成し、bert2BERT(+12.0%)およびLiGO(+20.7%)を訓練効率で上回った。
  • SQuADv1.1では、Mangoは90.17%のF1スコアを達成し、bert2BERT(90.02%)およびLiGO(90.09%)を下回るFLOPsで上回った。
  • GPT-SmallからGPT-Baseに転移する際、Mangoは59.9%の訓練加速比を達成し、収束速度においてbert2BERTおよびLiGOを上回った。
  • Mangoは全訓練プロセスを通じて最低の訓練損失を維持し、GPTにおいてbert2BERTおよびLiGOと比較してそれぞれ+16.7%および+21.8%の高いパフォーマンスを達成した。
  • 視覚、自然言語処理、言語モデリングのタスクにわたり一貫した向上効果を示し、本手法の一般化性とスケーラビリティを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。