Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Target Representations for Masked Autoencoders

Xingbin Liu, Jinghao Zhou|arXiv (Cornell University)|Sep 8, 2022
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

本論文は、マスクド自己符号化器におけるターゲット表現設計の手間を省くために、初期化されたモデルを教師として使用する多段階マスクド知識蒸留フレームワークであるdBOTを提案する。反復的に学生の重みを用いて教師を更新することで、ImageNet-1K、COCO、ADE20KにおいてViT-B/16、ViT-L/16、ViT-H/14で最先端の性能を達成し、MAEを含む従来の自己教師付き手法を上回る。

ABSTRACT

Masked autoencoders have become popular training paradigms for self-supervised visual representation learning. These models randomly mask a portion of the input and reconstruct the masked portion according to the target representations. In this paper, we first show that a careful choice of the target representation is unnecessary for learning good representations, since different targets tend to derive similarly behaved models. Driven by this observation, we propose a multi-stage masked distillation pipeline and use a randomly initialized model as the teacher, enabling us to effectively train high-capacity models without any efforts to carefully design target representations. Interestingly, we further explore using teachers of larger capacity, obtaining distilled students with remarkable transferring ability. On different tasks of classification, transfer learning, object detection, and semantic segmentation, the proposed method to perform masked knowledge distillation with bootstrapped teachers (dBOT) outperforms previous self-supervised methods by nontrivial margins. We hope our findings, as well as the proposed method, could motivate people to rethink the roles of target representations in pre-training masked autoencoders.The code and pre-trained models are publicly available at https://github.com/liuxingbin/dbot.

研究の動機と目的

  • マスクド自己符号化器における視覚表現学習に、ターゲット表現の選択が顕著に影響を与えるかどうかを調査すること。
  • マスクド自己符号化における効果的な知識蒸留には、事前学習済み教師ネットワークが必要かどうかを特定すること。
  • 事前学習や細かなターゲット設計を回避するシンプルで効果的な事前学習手法を開発すること。
  • 分類、検出、セグメンテーションを含む多様な下流ビジョンタスクにおける提案手法の性能を評価すること。

提案手法

  • 学生ネットワークが教師ネットワークを用いてマスクされたパッチを再構築するように学習する多段階マスクド蒸留パイプラインを提案する。
  • 初期教師としてランダムに初期化されたモデルを用い、各訓練段階の終了時に学生の重みで教師を更新する。
  • 学生を各段階後に最新の教師重みを用いて再初期化するブートストラップ訓練戦略を採用する。
  • 対称的および非対称なエンコーダ-デコーダアーキテクチャを用いて訓練し、再構築に標準的なL2損失を適用する。
  • 標準的なViT-L、ViT-Hなどの大規模事前学習済みモデルを教師として用い、それらからより小さな学生ネットワークに蒸留するフレームワークを拡張する。
  • DeiT、DINO、DALL-E、MAEなどの多様な教師とランダム初期化を比較するアブレーションスタディを実施する。

実験結果

リサーチクエスチョン

  • RQ1ターゲット表現(すなわち教師ネットワーク)の選択が、自己教師付き学習におけるマスクド自己符号化器の性能に顕著に影響を与えるか?
  • RQ2ランダムに初期化されたモデルが、視覚表現学習のためのマスクド知識蒸留において効果的な教師として機能できるか?
  • RQ3ブートストラップされた教師を用いた多段階蒸留は、さまざまなビジョンタスクにおいて一貫した性能向上をもたらすか?
  • RQ4大規模な教師からの蒸留は、下流性能と効率性の観点から、標準的な訓練と比較してどのように異なるか?
  • RQ5CLIPなどの大規模またはデータ豊富な教師を用いることで得られる性能向上は、分類、検出、セグメンテーションの各タスクで一貫しているか?

主な発見

  • DeiT、DINO、DALL-E、MAEなどの異なる事前学習済み教師から蒸留された学生ネットワークは、多段階蒸留後においてほぼ同一の性能を示し、教師の選択が影響をほとんど及えないことを示している。
  • ランダムに初期化されたモデルを教師として用いることで、事前学習済み教師と同等の性能を達成しており、ターゲット表現設計の注意深い設計が不要であることを示している。
  • dBOTはViT-B/16を用いてImageNet-1Kで84.5%のトップ1正解率を達成し、ViT-L/16では86.6%、ViT-H/14では88.0%を記録し、MAEや他の最先端の自己教師付き手法を上回っている。
  • COCOオブジェクト検出では、ViT-B/16で52.7 APボックス、ViT-L/16で56.0 APボックスを達成し、従来の手法を上回っている。
  • ADE20Kセマンティックセグメンテーションでは、ViT-B/16で49.5 mIoU、ViT-L/16で54.5 mIoUを達成し、新たな最先端結果を樹立している。
  • 大規模な教師(例:ViT-H)からの蒸留は、密度の高い予測タスクで顕著な向上をもたらす:ViT-Bでは+0.8 APボックスおよび+1.3 mIoU、ViT-Lでは+0.1 APボックスおよび+0.7 mIoUの向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。