[論文レビュー] Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design
この論文では、深さ、幅、MLP次元を同時に最適化することで得られる計算コスト最適化されたビジョントランスフォーマーであるSoViTを紹介する。このアプローチにより、ViT-g/14(1.8Bパラメータ)と同等の性能を達成しながら、推論コストを半分に抑えることができる。パラメータ数だけでなくモデル形状(深さ、幅、MLPサイズ)にまでスケーリング法則を適用することで、SoViT-400m/14はImageNet-1Kで90.3%の精度を達成し、同等の計算コスト下でゼロショットおよび従来のタスクでより大きなモデルを上回る性能を示した。
Scaling laws have been recently employed to derive compute-optimal model size (number of parameters) for a given compute duration. We advance and refine such methods to infer compute-optimal model shapes, such as width and depth, and successfully implement this in vision transformers. Our shape-optimized vision transformer, SoViT, achieves results competitive with models that exceed twice its size, despite being pre-trained with an equivalent amount of compute. For example, SoViT-400m/14 achieves 90.3% fine-tuning accuracy on ILSRCV2012, surpassing the much larger ViT-g/14 and approaching ViT-G/14 under identical settings, with also less than half the inference cost. We conduct a thorough evaluation across multiple tasks, such as image classification, captioning, VQA and zero-shot transfer, demonstrating the effectiveness of our model across a broad range of domains and identifying limitations. Overall, our findings challenge the prevailing approach of blindly scaling up vision models and pave a path for a more informed scaling.
研究の動機と目的
- モデルのパラメータ数だけでなく、深さ、幅、MLPサイズといったアーキテクチャ的形状まで最適化することで、計算効率を高める。
- ブルートフォース探索に比べてはるかに少ない実験回数で、計算コスト最適化されたモデル形状を特定する手法を開発する。
- 大規模モデルが常に優れるという一般的な仮定に挑戦し、同じ計算予算下で形状最適化された小規模モデルが大規模モデルを上回ることを示す。
- さまざまなビジョンタスクにおけるビジョントランスフォーマーの異なるアーキテクチャ的次元のスケーリング法について、実験的および理論的知見を提供する。
提案手法
- 著者らは、初期の少数の実験から得たデータをもとに、深さ、幅、MLP次元を同時に最適化するスケーリング法を導出する。
- モデル形状の次元を体系的にグリッドスキャンすることで、計算コスト最適なフロンティアを特定し、必要なトレーニング実行回数を最小限に抑える。
- パワーロー法を用いて、すべての候補モデルを完全にトレーニングせずに、異なるモデル形状における性能を予測する。
- このアプローチは、400MパラメータのSoViT-400m/14を、同じ計算予算下でViT-g/14(1.8Bパラメータ)と同等の性能に到達させるトレーニングにより検証された。
- 画像分類、キャプション生成、VQA、ゼロショット転送、パノプティックセグメンテーションの各タスクでモデルを評価し、汎化性能を測定した。
- フレキシフィケーションを適用して、パッチサイズの変更に対する耐性を確認した。その結果、SoViT-400m/14は元の設定を超えて強く、安定した性能を維持した。
実験結果
リサーチクエスチョン
- RQ1ビジョントランスフォーマーにおいて、深さ、幅、MLP次元といったモデル形状を同時に最適化することで、計算コスト最適化された性能を達成できるか?
- RQ2同じ計算予算でトレーニングされた場合、形状最適化された小規模ビジョントランスフォーマーは、より大きなモデルを上回る性能を示せるか?
- RQ3画像分類、キャプション生成、VQAといった異なるビジョンタスクにおいて、モデル形状のスケーリング法はどのように異なるか?
- RQ4入力解像度やパッチサイズの変更に対しても、最適なモデル形状は頑健であるか(フレキシフィケーションによって確認)?
- RQ5パノプティックセグメンテーションのような高密度予測タスクでは、計算コスト最適化されたモデル形状にどのような限界があるか?
主な発見
- SoViT-400m/14はImageNet-2012で微調整精度90.3%を達成し、ViT-g/14を上回り、ViT-G/14に近い性能を同じ計算予算下で示した。
- ゼロショット転送では、LiTベンチマークで82.2%の精度を達成し、ViT-L/16を上回り、ViT-g/14と同等の性能を示した。
- マルチタスクデコードでは、CIDEr(67.7 vs. 68.8)、VQAv2(56.0% vs. 58.0%)、GQA(52.9% vs. 52.5%)の各指標で、ViT-g/14と同等または上回る性能を示した。
- パノプティックセグメンテーションでは、SoViT-400m/14は43.7 PQを達成し、ViT-g/14(44.8 PQ)をわずかに下回った。これは、高密度予測タスクにおいて形状最適化の限界が顕在している可能性を示唆した。
- SoViT-400m/14のフレキシフィケーションにより、さまざまなパッチサイズでも強力な性能を維持した。これは、元の設定を超えた頑健性を確認した。
- 最適なスケーリングを特定するには115回の実験で十分であり、従来の単一次元最適化手法が400回を超える実験を要するのに対し、はるかに少ない実験回数で達成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。