Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Laws vs Model Architectures: How does Inductive Bias Influence Scaling?

Yi Tay, Mostafa Dehghani|arXiv (Cornell University)|Jul 21, 2022
Neural Networks and Applications被引用数 11
ひとこと要約

本論文は、異なるモデルアーキテクチャとその帰納的バイアスが言語モデルにおけるスケーリング法則にどのように影響するかを調査しており、10種類の多様なアーキテクチャをカバーする100のモデルを用いて、広範な事前学習と微調整を実施している。その結果、ヴァニラTransformerが最も強いスケーリング行動を示す一方で、MLP-Mixer、Performer、ALBERTといったアーキテクチャはサイズが大きくなるにつれてスケーリングがうまくいかない、あるいは性能が低下する傾向を示し、上流から下流への性能の転送可能性に関する仮定に疑問を呈している。

ABSTRACT

There have been a lot of interest in the scaling properties of Transformer models. However, not much has been done on the front of investigating the effect of scaling properties of different inductive biases and model architectures. Do model architectures scale differently? If so, how does inductive bias affect scaling behaviour? How does this influence upstream (pretraining) and downstream (transfer)? This paper conducts a systematic study of scaling behaviour of ten diverse model architectures such as Transformers, Switch Transformers, Universal Transformers, Dynamic convolutions, Performers, and recently proposed MLP-Mixers. Via extensive experiments, we show that (1) architecture is an indeed an important consideration when performing scaling and (2) the best performing model can fluctuate at different scales. We believe that the findings outlined in this work has significant implications to how model architectures are currently evaluated in the community.

研究の動機と目的

  • 異なるモデルアーキテクチャからの帰納的バイアスが、言語モデルにおけるスケーリング行動にどのように影響するかを理解すること。
  • 特定の計算量スケールでの性能が、異なるモデルサイズや計算領域におけるスケーラビリティを信頼的に予測できるかどうかを評価すること。
  • 上流の事前学習性能(パープレクシティ)と下流の転移性能の間の乖離を調査すること。
  • さまざまなスケーリングプロトコル(深さ vs. 幅)が、異なるアーキテクチャに与える影響を評価すること。
  • 多様な計算レジームにわたり、効果的にスケーリングするモデルを設計するための実証的知見を提供すること。

提案手法

  • 著者は、1500万から400億パラメータの範囲で、10種類の多様なアーキテクチャにまたがる100のモデルを事前学習および微調整した。
  • 上流(負の対数パープレクシティ)および下流(正解率)の性能をモデルサイズごとにフィッティングしたべき乗則モデルを用いてスケーリング法則を導出した。
  • 上流および下流の性能のスケーリング係数(α)を分析し、下流スケーリングを上流性能に対して相対的に測定するためのα_U,Dを導入した。
  • 代表的な4つのアーキテクチャ(MoS-Transformer、Transformer、Evolved Transformer、LConv)に、深さと幅を変化させる異なるスケーリングプロトコルを適用し、アーキテクチャ感受性を評価した。
  • 点的な評価を超えてスケーリングトレンドを捉えるために、複数の計算領域で実験を実施した。
  • 標準Transformerに加え、MLP-Mixer、Performer、およびダイナミック畳み込みなどの非Transformerアーキテクチャも分析に含めた。

実験結果

リサーチクエスチョン

  • RQ1異なるモデルアーキテクチャは、上流のパープレクシティと下流の正解率の観点から、どのようにスケーリングするか?
  • RQ2特定の計算量スケールでの強い性能が、モデルサイズ全体にわたるスケーラビリティを信頼的に予測できるか?
  • RQ3上流の事前学習性能と下流の転移性能の間の相関関係が、アーキテクチャ全体でどの程度成立するか?
  • RQ4異なるスケーリングプロトコル(深さ対幅)が、さまざまなアーキテクチャのスケーリング行動にどのように影響するか?
  • RQ5どの帰納的バイアスが強固なスケーリングをもたらし、どのバイアスが負のまたは平坦なスケーリングトレンドをもたらすか?

主な発見

  • ヴァニラTransformerが、すべてのアーキテクチャの中で最大のスケーリング係数αを示し、最も強いスケーリング行動を示した。
  • 低スケールでの絶対的性能は高いが、MLP-Mixer、Performer、ALBERTは特に下流タスクにおいて負または平坦なスケーリングトレンドを示した。
  • ALBERTは上流パープレクシティにおいて負のスケーリングを示しており、これはエンコーダーとデコーダー層にパラメータを共有しているためだと考えられる。
  • スイッチTransformerは、上流性能に対する下流スケーリングの観点で最高の性能(最高のα_U,D)を示し、強力な転送性を示している。
  • 標準Transformerに最小限の変更を加えたアーキテクチャ(例:GLU-Transformer、MoS-Transformer)は、ヴァニラTransformerと同様のスケーリング行動を維持した。
  • 深さのスケーリングは幅のスケーリングよりも下流性能により大きな影響を及ぼし、LConvはプロトコル間で一貫性のないスケーリングを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。