Skip to main content
QUICK REVIEW

[論文レビュー] RevColV2: Exploring Disentangled Representations in Masked Image Modeling

Qi Han, Yuxuan Cai|arXiv (Cornell University)|Sep 2, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

RevColV2は、マスク画像モデリング(MIM)における可逆的マルチカラム設計を用いて、低レベル特徴とセマンティック特徴を分離して学習する統合的オートエンコーダアーキテクチャを提案する。pre-trainingとfine-tuningの両段階でエンコーダーとデコーダーを維持することで、情報損失を回避し、特徴の混合を防ぐ。このアプローチにより、タスク固有のアダプタを必要とせず、画像分類、セマンティックセグメンテーション、オブジェクト検出の各タスクで最先端の性能を達成する。

ABSTRACT

Masked image modeling (MIM) has become a prevalent pre-training setup for vision foundation models and attains promising performance. Despite its success, existing MIM methods discard the decoder network during downstream applications, resulting in inconsistent representations between pre-training and fine-tuning and can hamper downstream task performance. In this paper, we propose a new architecture, RevColV2, which tackles this issue by keeping the entire autoencoder architecture during both pre-training and fine-tuning. The main body of RevColV2 contains bottom-up columns and top-down columns, between which information is reversibly propagated and gradually disentangled. Such design enables our architecture with the nice property: maintaining disentangled low-level and semantic information at the end of the network in MIM pre-training. Our experimental results suggest that a foundation model with decoupled features can achieve competitive performance across multiple downstream vision tasks such as image classification, semantic segmentation and object detection. For example, after intermediate fine-tuning on ImageNet-22K dataset, RevColV2-L attains 88.4% top-1 accuracy on ImageNet-1K classification and 58.6 mIoU on ADE20K semantic segmentation. With extra teacher and large scale dataset, RevColv2-L achieves 62.1 box AP on COCO detection and 60.4 mIoU on ADE20K semantic segmentation. Code and models are released at https://github.com/megvii-research/RevCol

研究の動機と目的

  • マスク画像モデリング(MIM)において、デコーダーが通常破棄されるため生じるpre-trainingとfine-tuningの不整合を是正し、情報損失や特徴の混合を回避すること。
  • pre-trainingとfine-tuningの両段階で統合的オートエンコーダアーキテクチャを維持することで、学習済みの特徴を保存し、転移性を向上させること。
  • 可逆的マルチカラムアーキテクチャが、MIMのpre-training段階で低レベル特徴とセマンティック特徴の分離学習をどのように可能にするかを調査すること。
  • 分離された特徴表現が、分類、セグメンテーション、検出を含む多様なビジョンタスクの下流性能を向上させるかどうかを実証すること。

提案手法

  • 下流方向の可逆的カラムエンコーダーと上流方向の可逆的カラムデコーダーを備えた対称的オートエンコーダを設計し、損失のない双方向特徴伝搬を可能にする。
  • 下流と上流のカラムの間に可逆接続を導入することで、勾配の流れを確保し、分離された特徴学習を支援する。
  • 上流デコーダーの終端で再構成損失を用い、階層的情報伝達を通じて低レベル特徴を下流に、セマンティック特徴を上流に誘導する。
  • fine-tuning段階でも完全なオートエンコーダを維持し、再トレーニングやアダプタ挿入なしにデコーダーが下流タスクの特徴に寄与できるようにする。
  • FLOPsを一定に保ち、公平なアーキテクチャおよびトレーニングスケジュール比較が可能なように、スケールの異なるモデル(例:RevColV2-L)を構築する。
  • さらに性能を向上させるために、強力な distillation シグナル(例:CLIP)と大規模データセット(例:ImageNet-22K)を活用する。

実験結果

リサーチクエスチョン

  • RQ1fine-tuning段階でもデコーダーを保持する統合的オートエンコーダアーキテクチャは、エンコーダーのみのMIM手法と比較して、下流タスクの性能を向上させるか?
  • RQ2RevColV2における可逆的マルチカラム設計は、MIMのpre-training段階で、低レベル特徴とセマンティック特徴の分離を効果的に実現できるか?
  • RQ3RevColV2における分離された特徴表現学習は、分類、セグメンテーション、検出といった多様なビジョンタスクへの転送性にどのように影響を与えるか?
  • RQ4トレーニングスケジュールの長さが、RevColV2モデルの最終性能に与える影響は何か?

主な発見

  • ImageNet-22Kで中間fine-tuningを経た後、RevColV2-LはImageNet-1K画像分類で88.4%のtop-1精度を達成した。
  • 追加のdistillationと大規模なpre-trainingを経て、RevColV2-LはCOCOオブジェクト検出で62.1 box AP、ADE20Kセマンティックセグメンテーションで60.4 mIoUを達成した。
  • アブレーションスタディの結果、可逆的マルチカラムデコーダーは、標準的なMAE、UNetスタイル、非可逆的カラムデコーダーを上回り、ImageNet-1Kで84.1%のtop-1精度を達成した。
  • より長いpre-trainingスケジュール(1600エポック)は顕著な向上をもたらした—300エポックと比較して、大規模モデルで+1.1%の精度向上—、長時間トレーニングにより最適化の潜在的性能が解き放たれることを示している。
  • 分離された特徴を備えた統合アーキテクチャは、複数のタスクで一貫して性能向上を示しており、下流適応段階でエンコーダーとデコーダーの両方を保持することが有益であることを実証している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。