Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting the Transferability of Supervised Pretraining: an MLP Perspective

Yizhou Wang, Shixiang Tang|arXiv (Cornell University)|Dec 1, 2021
Domain Adaptation and Few-Shot Learning参考文献 56被引用数 4
ひとこと要約

本論文では、分類器の前に多層パーセプトロン(MLP)プロジェクタを導入することで教師あり事前学習を強化する手法を提案する。この単純な追加により、クラス内変動を保持し、事前学習データセットと評価データセットの特徴分布距離を低減し、特徴の冗長性を減少させることで、転移性が顕著に向上することが明らかになった。本手法は、概念一般化(+7.2%トップ1正解率)、12ドメインの線形評価(+5.8%正解率)、COCOオブジェクト検出(+0.8%AP)の各タスクで最先端の性能を達成し、教師あり事前学習が非教師あり手法と同等またはそれを上回る性能を発揮することを示した。

ABSTRACT

The pretrain-finetune paradigm is a classical pipeline in visual learning. Recent progress on unsupervised pretraining methods shows superior transfer performance to their supervised counterparts. This paper revisits this phenomenon and sheds new light on understanding the transferability gap between unsupervised and supervised pretraining from a multilayer perceptron (MLP) perspective. While previous works focus on the effectiveness of MLP on unsupervised image classification where pretraining and evaluation are conducted on the same dataset, we reveal that the MLP projector is also the key factor to better transferability of unsupervised pretraining methods than supervised pretraining methods. Based on this observation, we attempt to close the transferability gap between supervised and unsupervised pretraining by adding an MLP projector before the classifier in supervised pretraining. Our analysis indicates that the MLP projector can help retain intra-class variation of visual features, decrease the feature distribution distance between pretraining and evaluation datasets, and reduce feature redundancy. Extensive experiments on public benchmarks demonstrate that the added MLP projector significantly boosts the transferability of supervised pretraining, e.g. +7.2% top-1 accuracy on the concept generalization task, +5.8% top-1 accuracy for linear evaluation on 12-domain classification tasks, and +0.8% AP on COCO object detection task, making supervised pretraining comparable or even better than unsupervised pretraining.

研究の動機と目的

  • 教師あり事前学習が、より豊富な意味的ラベルを用いているにもかかわらず、転移学習においてなぜ非教師あり事前学習にしばしば劣るのかを解明すること。
  • 事前学習と下流タスクのデータセット間に大きな意味的ギャップがある場合に、教師あり事前学習の転移性が制限される要因となる、欠落している要因を同定すること。
  • 教師あり事前学習にMLPプロジェクタを追加することで、非教師あり手法との性能ギャップを埋められることを評価すること。
  • MLPプロジェクタが転移学習における特徴品質の向上に果たす役割について、実証的かつ理論的根拠を提示すること。

提案手法

  • 標準的な教師あり事前学習(SL)に分類器の前にMLPプロジェクタを導入し、特徴表現の転移性を向上させるSL-MLPを構築する。
  • MLPプロジェクタを用いて、事前学習中に視覚的特徴のクラス内変動を保持し、クラス固有のパターンへの過剰適合を防ぐ。
  • MLPプロジェクタを用いて、事前学習データセットと評価データセットの特徴分布距離を低減し、ドメイン一般化性能を向上させる。
  • バックボーンと分類器をクロスエントロピー損失で同時に学習する一方、MLPプロジェクタはエンドツーエンドで学習させ、分類の直前で特徴を精緻化する。
  • MLPの隠れユニット数と出力次元の感度とロバストネスを評価するため、広範なアブレーションスタディを実施する。
  • 複数のベンチマークでSL-MLPを評価する:概念一般化、12ドメインの線形評価、COCOオブジェクト検出。非教師あり手法(BYOL, SimCLRなど)と比較する。

実験結果

リサーチクエスチョン

  • RQ1教師あり事前学習が、より豊富なアノテーションを用いているにもかかわらず、なぜ転移学習において非教師あり事前学習にしばしば劣るのか?
  • RQ2BYOL や SimCLR といった非教師あり事前学習手法の優れた転移性を支える要因として、MLPプロジェクタが果たす役割は何か?
  • RQ3標準的な教師あり事前学習にMLPプロジェクタを追加することで、非教師あり手法との性能ギャップを埋められるか?
  • RQ4MLPプロジェクタは、事前学習特徴のクラス内変動、特徴分布距離、冗長性にどのように影響を与えるか?
  • RQ5MLPプロジェクタによる性能向上は、異なるアーキテクチャ、データセット、下流タスクにおいてもロバストか?

主な発見

  • 標準的なSLに比べ、教師あり事前学習にMLPプロジェクタを追加したSL-MLPは、概念一般化タスクでトップ1正解率を+7.2%向上させた。
  • 12ドメインの線形評価では、SLに比べ平均で+5.8%の正解率向上を達成し、一部の設定ではBYOLをも上回った。
  • COCOオブジェクト検出タスクでも、APを+0.8%向上させ、密度の高い予測タスクへの一般化性能が顕著に向上した。
  • MLPプロジェクタは、特徴のクラス内変動を保持することで、多様な下流タスクにおいても識別的構造を維持するのを助けた。
  • 事前学習データセットと評価データセットの特徴分布距離が、MLPプロジェクタのおかげで顕著に低減され、ドメイン一般化性能が向上した。
  • MLPプロジェクタによる性能向上は、隠れユニット数や出力次元といったハイパーパrameterの選択に強く依存せず、安定性と実用性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。