Skip to main content
QUICK REVIEW

[論文レビュー] A Closer Look at Self-Supervised Lightweight Vision Transformers

Shaoru Wang, Jin Gao|arXiv (Cornell University)|May 28, 2022
Advanced Neural Network Applications被引用数 8
ひとこと要約

本稿は、軽量Vision Transformer(ViT)における自己教師あり事前学習を調査し、適切にMAEで事前学習されたvanilla ViT-Tiny(5.7Mパラメータ)が79.0%のImageNet top-1精度を達成することを示しており、複雑な設計をもつ最先端のアーキテクチャと同等の性能を発揮することを実証している。また、事前学習が十分な下流データがある場合、下位層に有利に働くことを明らかにし、MAE事前学習中に特徴を蒸留する戦略を導入することで、特にデータが少ないタスクにおいて性能が向上することを示している。

ABSTRACT

Self-supervised learning on large-scale Vision Transformers (ViTs) as pre-training methods has achieved promising downstream performance. Yet, how much these pre-training paradigms promote lightweight ViTs' performance is considerably less studied. In this work, we develop and benchmark several self-supervised pre-training methods on image classification tasks and some downstream dense prediction tasks. We surprisingly find that if proper pre-training is adopted, even vanilla lightweight ViTs show comparable performance to previous SOTA networks with delicate architecture design. It breaks the recently popular conception that vanilla ViTs are not suitable for vision tasks in lightweight regimes. We also point out some defects of such pre-training, e.g., failing to benefit from large-scale pre-training data and showing inferior performance on data-insufficient downstream tasks. Furthermore, we analyze and clearly show the effect of such pre-training by analyzing the properties of the layer representation and attention maps for related models. Finally, based on the above analyses, a distillation strategy during pre-training is developed, which leads to further downstream performance improvement for MAE-based pre-training. Code is available at https://github.com/wangsr126/mae-lite.

研究の動機と目的

  • 自己教師あり事前学習が、特にViT-Tinyのような軽量Vision Transformerに与える効果を、最先端のアーキテクチャと比較して評価すること。
  • 自己教師あり事前学習が下流タスクの性能を向上させる理由と仕組みを、特にデータが少ない状況下で解明すること。
  • 事前学習および微調整におけるViTの各層の表現行動を分析し、下流性能に影響を与える要因を特定すること。
  • MAEに基づく事前学習中にさらに性能を向上させるために、蒸留戦略を開発・検証すること。

提案手法

  • ImageNet分類および密度予測タスクにおいて、ViT-Tinyを対象に、MoCo-v3(対照的学習)およびMAE(マスキング画像モデリング)といった複数の自己教師あり事前学習手法をベンチマーク化した。
  • 異なるネットワーク深さにおける特徴表現および注目マップの広範な分析を通じて、事前学習が特徴学習に与える影響を検討した。
  • 十分なラベル付きデータがある場合、下位層がより重要であるのに対し、データが少ない状況では上位層が優位に働くことが同定された。
  • MAE事前学習が注目マップを集中させることで局所性のインダクティブバイアスを導入しており、これが性能向上に寄与していることが判明した。
  • より大きな教師ネットワークが学生のViT-Tinyをガイドする蒸留戦略を提案した。この戦略により、特に上位層の特徴品質が向上した。
  • ImageNet、Flowers、Aircraft、CIFAR100、COCO検出およびセグメンテーションベンチマークで手法を検証し、蒸留部品のアブレーションスタディも実施した。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり事前学習によって、構造が複雑な最先端アーキテクチャと比較して、vanilla軽量ViTが性能の差を埋めることができるか?
  • RQ2事前学習と微調整の間でViTの各層の表現学習行動はどのように異なるのか。また、下流データ量に依存してどのように変化するのか?
  • RQ3なぜMAE事前学習がより良い下流性能をもたらすのか。どのようなインダクティブバイアスを導入するのか?
  • RQ4MAE事前学習中に知識蒸留を適用することで、軽量ViTの性能をさらに向上させることができるか?

主な発見

  • 適切にMAEで事前学習されたvanilla ViT-Tinyは、ImageNetで79.0%のtop-1精度を達成し、構造が複雑な前例のSOTAモデルと同等またはそれを上回る性能を発揮した。
  • 十分なラベル付きデータがある場合、事前学習済みViTの下位層が下流性能に大きく寄与するが、データが少ない状況では上位層の寄与度が高まる。
  • MAE事前学習が注目マップを集中させることで局所性のインダクティブバイアスを導入しており、一般化性能および性能向上と相関している。
  • 提案されたMAE事前学習中の蒸留戦略により、特にデータが不足する分類および密度予測タスク(例:COCOオブジェクト検出・セグメンテーション)において下流性能が顕著に向上した。
  • 蒸留手法により、特に上位層の特徴品質が向上し、教師ネットワーク出力との整合性が向上し、表現学習の質が向上したことが実証された。
  • 線形プローブ評価により、提案手法で得られた表現が、複数の下流タスクにわたって良好に一般化されることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。