[論文レビュー] Masked Image Residual Learning for Scaling Deeper Vision Transformers
本稿では、マスク画像モデリング(MIM)における深層化に伴う性能劣化を軽減するために、画像の再構成から画像の残差再構成へと目的関数を再定式化する自己教師付きフレームワーク、Masked Image Residual Learning(MIRL)を提案する。MIRLにより、より深いVision Transformer(ViTs)の事前学習が可能となり、ViT-S-54 や ViT-B-48 といった深層モデルが、ViT-Large よりも優れた性能を達成し、ImageNet で 86.2% のトップ-1正答率を記録。さらに、下流タスクへの一般化性能も優れている。
Deeper Vision Transformers (ViTs) are more challenging to train. We expose a degradation problem in deeper layers of ViT when using masked image modeling (MIM) for pre-training. To ease the training of deeper ViTs, we introduce a self-supervised learning framework called Masked Image Residual Learning (MIRL), which significantly alleviates the degradation problem, making scaling ViT along depth a promising direction for performance upgrade. We reformulate the pre-training objective for deeper layers of ViT as learning to recover the residual of the masked image. We provide extensive empirical evidence showing that deeper ViTs can be effectively optimized using MIRL and easily gain accuracy from increased depth. With the same level of computational complexity as ViT-Base and ViT-Large, we instantiate 4.5$ imes$ and 2$ imes$ deeper ViTs, dubbed ViT-S-54 and ViT-B-48. The deeper ViT-S-54, costing 3$ imes$ less than ViT-Large, achieves performance on par with ViT-Large. ViT-B-48 achieves 86.2% top-1 accuracy on ImageNet. On one hand, deeper ViTs pre-trained with MIRL exhibit excellent generalization capabilities on downstream tasks, such as object detection and semantic segmentation. On the other hand, MIRL demonstrates high pre-training efficiency. With less pre-training time, MIRL yields competitive performance compared to other approaches.
研究の動機と目的
- マスク画像モデリング(MIM)による事前学習において、Vision Transformer(ViTs)の深層部で観察される性能劣化を解消すること。
- MIMが深層ViTブロックに悪影響を及える最適化の負の効果を同定すること。
- 深層部の事前学習目的を画像再構成から残差再構成へと変更する、新しい自己教師付き学習フレームワークの開発。
- より良い一般化性能と効率性を実現する深層ViTsの有効な訓練を可能にし、計算コストを低く抑えながら最先端の性能を達成すること。
- MIRLが既存の特徴レベル損失手法と直交的で補完的であることを実証すること。
提案手法
- ViTエンコーダーを浅層部と深層部に分割し、それぞれに専用のデコーダーを設けることでマルチデコーディングを実現。
- 深層部の事前学習目的を、マスクされた画像パッチの完全な再構成から、その残差の予測へと再定式化する。
- 浅層部が主成分を再構成し、深層部が残差を学習するマルチデコーディングアーキテクチャを採用。
- 浅層部には標準的なマスク画像モデリング(MIM)目的を、深層部には残差再構成目的を適用。
- エンコーダーをより多くの深さレベルに分割することで、複数セグメントへの拡張を可能にし、極めて深いViTsの学習を可能にする。
- VGG損失などの追加的特徴レベル目的を統合することで性能をさらに向上させ、MIRLと直交的であることを示す。
実験結果
リサーチクエスチョン
- RQ1なぜ、NLPおよびビジョン分野で成功を収めたMIMであっても、Vision Transformer(ViTs)の深層部では性能劣化が生じるのか?
- RQ2深層ViT部の事前学習目的を画像再構成から残差再構成へと再定式化することで、性能劣化が軽減されるか?
- RQ3MIRLはどの程度、性能と効率を維持または向上させながら、ViTsの深さ方向へのスケーリングを可能にするか?
- RQ4既存のMIMベース手法や特徴レベル損失アプローチと比較して、MIRLの事前学習効率および下流タスクへの転移性能はどの程度か?
- RQ5MIRLによる性能向上は、特徴レベル損失などの他の正則化手法と直交的であるか?
主な発見
- MIRLは、標準的なMIMが引き起こす深層ViT部の劣化問題を効果的に軽減し、より深いアーキテクチャの安定した学習を可能にする。
- ViT-S-54(ViT-Base より4.5倍深く、ViT-Large より3倍安価)は、ImageNet でViT-Large と同等の性能を達成。
- ViT-B-48(ViT-Base より2倍深い)は、同程度の計算コストでImageNetで86.2%のトップ-1正答率を達成し、標準的なViT-Largeを上回る。
- MIRLで事前学習されたモデルは、下流タスクでの一般化性能が優れており、ADE20Kのセマンティックセグメンテーションで53.2%のmIoUを達成。これは、より多くのデータや長時間の学習スケジュールで事前学習されたモデルと同等の性能。
- MIRLフレームワークは非常に効率的であり、MAE や BEiT といったベースライン手法と比較して、著しく短い事前学習時間で競争力のある性能を達成。
- 勾配解析により、MIRLは深層部での勾配フローを向上させ、vanilla MIM よりも高い勾配ノルムを示しており、改善された学習ダイナミクスを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。