Skip to main content
QUICK REVIEW

[論文レビュー] Broken Neural Scaling Laws

Ethan Caballero, Kshitij Gupta|arXiv (Cornell University)|Oct 26, 2022
Neural Networks and Applications被引用数 14
ひとこと要約

本論文は、多様なタスクやアーキテクチャにわたるディープラーニングのスケーリング行動をモデル化・外挿するための滑らかな区分的べき乗法則関数形である破損ニューラルスケーリング則(BNSL)を導入する。BNSLは、従来のべき乗法則ではモデル化できなかった非単調な現象、例えばダブルデセントや鋭い分岐点を捉え、視覚、言語、音声、ロボット工学、AI整合性のタスクにおいて、100,000倍以上の大きな計算リソース領域へのスケーリングにも優れた外挿精度を示している。

ABSTRACT

We present a smoothly broken power law functional form (that we refer to as a Broken Neural Scaling Law (BNSL)) that accurately models & extrapolates the scaling behaviors of deep neural networks (i.e. how the evaluation metric of interest varies as amount of compute used for training (or inference), number of model parameters, training dataset size, model input size, number of training steps, or upstream performance varies) for various architectures & for each of various tasks within a large & diverse set of upstream & downstream tasks, in zero-shot, prompted, & finetuned settings. This set includes large-scale vision, language, audio, video, diffusion, generative modeling, multimodal learning, contrastive learning, AI alignment, AI capabilities, robotics, out-of-distribution (OOD) generalization, continual learning, transfer learning, uncertainty estimation / calibration, OOD detection, adversarial robustness, distillation, sparsity, retrieval, quantization, pruning, fairness, molecules, computer programming/coding, math word problems, "emergent phase transitions", arithmetic, supervised learning, unsupervised/self-supervised learning, & reinforcement learning (single agent & multi-agent). When compared to other functional forms for neural scaling, this functional form yields extrapolations of scaling behavior that are considerably more accurate on this set. Moreover, this functional form accurately models & extrapolates scaling behavior that other functional forms are incapable of expressing such as the nonmonotonic transitions present in the scaling behavior of phenomena such as double descent & the delayed, sharp inflection points present in the scaling behavior of tasks such as arithmetic. Lastly, we use this functional form to glean insights about the limit of the predictability of scaling behavior. Code is available at https://github.com/ethancaballero/broken_neural_scaling_laws

研究の動機と目的

  • ディープラーニングスケーリングにおける非単調的および分岐点行動をモデル化する際、従来のべき乗法則スケーリング則の限界を克服すること。
  • 広範なAIタスクおよびアーキテクチャにわたるスケーリング行動を正確にモデル化・外挿できる関数形の開発。
  • 特に出現的機能や安全に重要な行動を含む、大規模スケールでのモデル性能の信頼性ある予測を可能にすること。
  • 既存のモデルが到達できない範囲、特に極端なスケール外挿(例:訓練データの100,000倍以上大きいスケール)を含む、スケーリング則の統一的フレームワークの提供。

提案手法

  • 対数-対数空間における区分的線形関数として、滑らかな破損べき乗法則(BNSL)を提案。複数のセグメントが異なる勾配を持ち、滑らかな遷移で接続される。
  • 各セグメントを y = a + b * x^(-c) として定義。勾配が変化する地点(ブレークポイント)を設け、急激または徐々なスケーリング行動の変化をモデル化可能にする。
  • 実験的データからパラメータ(a, b, c およびブレークポイント)を推定するために、非線形最小二乗法(SciPyを用いて)を用いる。
  • 視覚、言語、音声、ロボット工学、強化学習、AI整合性にわたる30以上のタスクで、実世界のデータセットおよび公表済み結果を用いてモデルを検証。
  • ゼロショット、プロンプト設定、ファインチューニング設定の各状況で、BNSLの外挿性能を標準べき乗法則および他の関数形と比較。
  • GPT-4やその他の大規模モデルに対し、観測された最大スケールの100,000倍以上大きなスケールにまでスケーリング曲線を外挿するためにBNSLを適用。

実験結果

リサーチクエスチョン

  • RQ1ダブルデセントや遅延分岐点といった非単調スケーリング行動を正確にモデル化・外挿できる関数形を開発可能か?
  • RQ2特に急激な遷移や複雑なスケーリングダイナミクスを示すタスクにおいて、BNSLは観測範囲外のスケーリング則をどの程度正確に外挿できるか?
  • RQ3視覚、言語、音声、マルチモーダル学習を含む、ゼロショット、プロンプト設定、ファインチューニングの各状況において、BNSLは多様なAIタスクにどの程度一般化可能か?
  • RQ4訓練データの100,000倍以上大きなスケールでのスケーリング行動を、従来のべき乗法則よりも高い精度で予測できるか?
  • RQ5BNSLは、ディープラーニングシステムにおけるスケーリング行動の予測限界について、どのような洞察を提供するか?

主な発見

  • BNSLは、視覚、言語、音声、ロボット工学、AI整合性を含む30以上の多様なAIタスクで、スケーリング行動を正確にモデル化・外挿し、標準べき乗法則を上回る性能を示している。
  • BNSLは、ダブルデセントや鋭い分岐点といった非単調行動を的確に捉えており、これらは従来のべき乗法則では表現できない現象である。
  • スケーリング則ベンチマーク(Alabdulmohsin et al., 2022)において、BNSLはImageNet、CIFAR-100、Caltech101、BIG-Benchについても正確な外挿を達成しており、ブレークポイント付近のデータ不足によるわずかな失敗が一部に見られるのみである。
  • 下流の言語およびコーディングタスクでは、GPT-4の訓練計算リソースと性能のデータを用いて、観測された最大スケールの100,000倍以上大きな計算リソース領域へのスケーリング曲線をBNSLが外挿している。
  • 特に極端なスケールやフェーズ遷移の際の性能予測において、他の関数形と比較してBNSLは優れた外挿精度を示している。
  • モデルは、スケーリング行動が常に単調ではないこと、およびスケーリング曲線におけるブレークポイントが一般的で予測可能なことの実証を示しており、今後のモデル開発においてこのような構造的シフトを考慮する必要があることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。