[論文レビュー] Scaling Vision Transformers
この論文は、100万枚から30億枚の画像を含むデータセットを用いて、500万から20億パラメータのモデルをTPUv3で最大1万コア日までスケーリングし、ビジョントランスフォーマー(ViT)のスケーリング法則を調査している。特に最終層への強いL2正則化を含む、アーキテクチャ的およびトレーニングの改善により、20億パラメータのViTがImageNetで90.45%のトップ1精度を達成し、新たなSOTAを樹立した。また、クラスあたり10ショットでの精度は84.86%に達した。
Attention-based neural networks such as the Vision Transformer (ViT) have recently attained state-of-the-art results on many computer vision benchmarks. Scale is a primary ingredient in attaining excellent results, therefore, understanding a model's scaling properties is a key to designing future generations effectively. While the laws for scaling Transformer language models have been studied, it is unknown how Vision Transformers scale. To address this, we scale ViT models and data, both up and down, and characterize the relationships between error rate, data, and compute. Along the way, we refine the architecture and training of ViT, reducing memory consumption and increasing accuracy of the resulting models. As a result, we successfully train a ViT model with two billion parameters, which attains a new state-of-the-art on ImageNet of 90.45% top-1 accuracy. The model also performs well for few-shot transfer, for example, reaching 84.86% top-1 accuracy on ImageNet with only 10 examples per class.
研究の動機と目的
- ビジョントランスフォーマーのモデルサイズ、データ、計算量のスケーリング法則を、NLPトランスフォーマーと比較して理解すること。
- 表現品質と少サンプル転移性能を向上させるために、アーキテクチャ的およびトレーニングレシピの改善を同定すること。
- 20億パラメータの大型ViTモデルをトレーニングし、ImageNetおよび少サンプル転移ベンチマークでの性能を評価すること。
- パフォーマンス-計算量フロンティアを特徴づけ、スケーリングにおけるボトルネック(モデルサイズ、データ、計算量)を同定すること。
- ハードウェアに配慮した設計と最適化手法を用いて、ViTのメモリ消費量を削減しながら、精度を維持または向上させること。
提案手法
- TPUv3ハードウェアを用いて、ImageNet-21kおよび最大30億の弱ラベル付き画像を用いて、500万から20億パラメータのViTモデルをスケーリングする。
- ImageNet、CIFAR-100、Oxford IIIT Pets、Caltech-UCSD Birdsにおける線形10ショット評価とフルファインチューニングを用いて、表現品質を測定する。
- 少サンプル転移性能の向上を図るため、最終線形分類層に強いL2正則化を適用する。
- 収束性と一般化性能の向上を目的に、学習率、クールダウンステップ数、重み減衰などのトレーニングハイパーパrameterを最適化する。
- ハードウェアに特化したアーキテクチャ的変更と修正された最適化手法を用いて、メモリ消費量を削減し、20億パラメータのモデルのトレーニングを可能にする。
- さまざまな計算量、モデルサイズ、データスケールにおけるパフォーマンス-計算量フロンティアを近似するために、飽和型のべき乗則モデルを用いる。
実験結果
リサーチクエスチョン
- RQ1モデルサイズ、トレーニングデータ、計算予算を増加させた場合、ViTモデルの精度はどのように変化するか?
- RQ2異なる設定下で、ViTスケーリングにおける主なボトルネックは、モデル容量、データセットサイズ、計算量のうちどれか?
- RQ3最終層への強いL2正則化は、ViTモデルの少サンプル転移性能にどのように影響するか?
- RQ4アーキテクチャ的およびトレーニングレシピの改善により、より大きなViTモデルを可能にしながら、メモリ消費量を削減できるか?
- RQ5NLPトランスフォーマーで観察されたスケーリング法則が、ビジョン分野へどの程度一般化できるか?
主な発見
- 20億パラメータのビジョントランスフォーマーが、ImageNetで90.45%のトップ1精度を達成し、新たなSOTAを樹立した。
- クラスあたり10例での10ショット線形評価において、ViT-GモデルがImageNetで84.86%のトップ1精度に達した。
- 1例/クラスでの精度は69.52%に達し、強力な少サンプル転移能力を示した。
- より大きなモデルは、10億枚を超えるデータでもさらなる利益を得ており、3000万〜3億枚のデータでは最大モデルが飽和しないことが示された。
- 小さなモデルは、長時間トレーニングを行うと性能-計算量フロンティアから外れ、過学習または計算非効率性の兆候を示した。
- ハードウェアに特化したアーキテクチャ的変更と最適化手法の修正により、メモリ消費量が大幅に削減され、20億パラメータのViTのトレーニングが可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。