Skip to main content
QUICK REVIEW

[論文レビュー] Exploring the Limits of Large Scale Pre-training

Samira Abnar, Mostafa Dehghani|arXiv (Cornell University)|Oct 5, 2021
Multimodal Machine Learning Applications参考文献 52被引用数 35
ひとこと要約

本論文は、Vision Transformers、MLP-Mixers、ResNetsに跨る大規模な事前学習を用いても、上流の精度が高まるにつれて下流の画像認識性能が飽和することを示し、上流の精度から下流の性能を予測するパワー法モデルを提供している。

ABSTRACT

Recent developments in large-scale machine learning suggest that by scaling up data, model size and training time properly, one might observe that improvements in pre-training would transfer favorably to most downstream tasks. In this work, we systematically study this phenomena and establish that, as we increase the upstream accuracy, the performance of downstream tasks saturates. In particular, we investigate more than 4800 experiments on Vision Transformers, MLP-Mixers and ResNets with number of parameters ranging from ten million to ten billion, trained on the largest scale of available image data (JFT, ImageNet21K) and evaluated on more than 20 downstream image recognition tasks. We propose a model for downstream performance that reflects the saturation phenomena and captures the nonlinear relationship in performance of upstream and downstream tasks. Delving deeper to understand the reasons that give rise to these phenomena, we show that the saturation behavior we observe is closely related to the way that representations evolve through the layers of the models. We showcase an even more extreme scenario where performance on upstream and downstream are at odds with each other. That is, to have a better downstream performance, we need to hurt upstream accuracy.

研究の動機と目的

  • 多様なアーキテクチャとデータセットにまたがり、上流の事前学習精度の向上が下流の画像認識タスクへどのように伝わるかを調査する。
  • 上流の精度が向上するにつれて下流の性能の飽和現象を定量化する。
  • 非線形性やデータ/サンプルバイアスを考慮する、上流と下流の精度を結ぶ堅牢な予測モデル(パワー法)を開発する。
  • 下流への転送に影響を与えるアーキテクチャ要因とハイパーパラメータを特定し、さらなる上流の利得が下流タスクに必ずしも恩恵をもたらさない領域を明らかにする。

提案手法

  • JFTまたはImageNet21Kで事前学習され、20超の下流タスクで評価された Vision Transformers、MLP-Mixers、ResNets にわたる4,800件超の実験を集約・分析する。
  • 不可約誤差項を伴うべき乗則形式を用いて、下流の性能を上流の精度の関数としてモデル化する。
  • 凸包(最良ケース)フィッティングを用いてサンプリングバイアスを緩和し、与えられたUS精度に対する最大のDS性能を捉える。
  • モデルサイズ、データサイズ、計算量を変化させた制御されたスケーリング実験を行い、US精度を介してDS性能への影響を評価する。
  • 層ごとの表現の進化を観察し、観測された飽和現象を説明する。
  • ヘッドのハイパーパラメータ設定が頭部から下位層へ情報を押し出す場合に、上流と下流の性能が乖離するケースを検討する。

実験結果

リサーチクエスチョン

  • RQ1スケーリングやハイパーパラメータの変更を通じて上流の精度を改善すると、タスク全体で下流の精度が比例的に向上するか?
  • RQ2下流の性能は上流の利得とともに普遍的に向上するのか、それとも飽和が生じるのか?
  • RQ3アーキテクチャやタスクを超えて、単純なモデルを用いて下流の性能を上流の精度から信頼性高く予測できるか?
  • RQ4DS-USの関係と飽和レベルを変調する要因(アーキテクチャ、データ、計算資源、ハイパーパラメータ)は何か?
  • RQ5特定のハイパーパラメータ設定の下で、上流と下流の性能が乖離する理由は何か?

主な発見

  • 上流の精度が上がるにつれて下流の精度は飽和し、DSは高いUS精度でも100%に達することは稀である。
  • 不可約誤差項を伴うべき乗則関係が、タスクとショットをまたいでDSとUSの性能を効果的にモデル化する。
  • 下流タスクにおける最良のモデルは、上流精度が同程度でもタスク間で異なる。ワンモデルで全タスクを適合させることはできない。
  • 結果の凸包にべき乗則を適合させることで、サンプル密度に敏感でない頑健なDS予測が得られる。
  • US精度はDS精度の予測力を高く、US精度を条件にすると、DS性能に対してモデルサイズ、データサイズ、計算量を変えて得られる追加的な価値が減少する。
  • ヘッドのウェイト減衰や学習率を含むハイパーパラメータの選択によってDSとUSの性能が乖離することがあり、情報がヘッドから下層へ押し出されることにより説明される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。