Skip to main content
QUICK REVIEW

[論文レビュー] A Unified View of Masked Image Modeling

Zhiliang Peng, Dong Li|arXiv (Cornell University)|Oct 19, 2022
Advanced Neural Network Applications被引用数 14
ひとこと要約

この論文は、CLIPベースの教師モデルからマスクされた画像パッチにおける正規化された意味特徴を再構築することで、自己教師付き事前学習に適したシンプルで効果的なマスクド画像モデリング手法であるMaskDistillを提案する。学生用のビジョンTransformerに全結合MIMヘッドとSmooth-$\ell_1$損失を用いる。300エポックの事前学習後、ViT-H/14モデルを用いてImageNet-1kで88.3%のトップ1正解率、ADE20kで58.8%のmIoUを達成し、最先端性能を実現した。

ABSTRACT

Masked image modeling has demonstrated great potential to eliminate the label-hungry problem of training large-scale vision Transformers, achieving impressive performance on various downstream tasks. In this work, we propose a unified view of masked image modeling after revisiting existing methods. Under the unified view, we introduce a simple yet effective method, termed as MaskDistill, which reconstructs normalized semantic features from teacher models at the masked positions, conditioning on corrupted input images. Experimental results on image classification and semantic segmentation show that MaskDistill achieves comparable or superior performance than state-of-the-art methods. When using the huge vision Transformer and pretraining 300 epochs, MaskDistill obtains 88.3% fine-tuning top-1 accuracy on ImageNet-1k (224 size) and 58.8% semantic segmentation mIoU metric on ADE20k (512 size). The code and pretrained models will be available at https://aka.ms/unimim.

研究の動機と目的

  • 大規模なビジョンTransformerのトレーニングにおけるラベル依存性の問題に対処するため、マスクド画像モデリング(MIM)のための統合フレームワークを提案すること。
  • 既存のMIM手法の多様な設計を統一的な枠組みに統合し、その設計空間を体系的かつ包括的に明らかにすること。
  • 複雑なアーキテクチャの変更を伴わずに性能を向上させる、シンプルで効果的なMIM手法、MaskDistillを開発すること。
  • 強力な教師モデルから正規化された意味特徴を蒸留することで、より良い一般化性能と下流タスク性能が得られることを示すこと。

提案手法

  • 本手法は、教師モデル、正規化層、学生モデル、MIMヘッド、損失関数から構成される統合的MIMフレームワークに裏打ちされている。
  • MaskDistillは、マスクされたパッチにおける高レベルな正規化された特徴表現を提供する目的で、CLIPのViT-B/16を教師モデルとして用いる。
  • 学生モデルは、損傷を加えた入力パッチを受け取り、教師モデルの対応する正規化された特徴を予測するビジョンTransformer(ViT)である。
  • 全結合MIMヘッドは、学生モデルの表現を、マスクされた位置における教師の正規化された特徴ベクトルに一致させる。
  • 訓練の安定性とアライメントの向上を図るため、教師の出力特徴に層正規化を適用する。
  • 予測値とターゲットの正規化された特徴の乖離を測定するために、Smooth-$\ell_1$損失関数を用いる。これにより、外れ値に対してよりロバストな性能が得られる。

実験結果

リサーチクエスチョン

  • RQ1既存のマスクド画像モデリング手法の多様な設計を、共通のフレームワークに統合することは可能か?
  • RQ2教師モデルの選択がマスクド画像モデリングの性能に果たす役割は何か?
  • RQ3強力な教師モデルから正規化された意味特徴を再構築するシンプルなMIM手法は、特別な設計を施した複雑なアーキテクチャを上回る性能を発揮できるか?
  • RQ4生のピクセルや離散トークンではなく、正規化された特徴を蒸留することで、より良い一般化性能と下流タスク性能が得られるか?

主な発見

  • 300エポックの事前学習後、ViT-H/14モデルを用いてImageNet-1kで88.3%のトップ1正解率を達成し、最先端の手法を上回るか同等の性能を示した。
  • ADE20kのセマンティックセグメンテーションベンチマークでは、58.8%のmIoUを達成し、密度予測タスクへの優れた転送性能を示した。
  • スタイライズドImageNetのバリエーションにおける一般化性能の向上が示され、学習された表現における形状バイアスの向上が裏付けられた。これは、本手法のロバスト性の要因である可能性がある。
  • アブレーションスタディの結果、生のピクセルや他の監視信号と比較して、CLIP教師モデルからの正規化された特徴を用いることで、より効果的な性能が得られることを確認した。
  • ベース、ラージ、フューチャーの異なるモデルサイズにおいて一貫した向上が観察された。これは、本手法のスケーラビリティとロバスト性を示している。
  • CLIPがマルチモーダルモデルであるにもかかわらず、言語の監視を必要とせず、下流タスクへの一般化性能が良好であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。