Skip to main content
QUICK REVIEW

[論文レビュー] Pushing the limits of self-supervised ResNets: Can we outperform supervised learning without labels on ImageNet?

Nenad Tomašev, Ioana Bica|arXiv (Cornell University)|Jan 13, 2022
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

本論文は、背景やスタイルなどの誤った特徴を抑えるための誘導的バイアスを組み込むことで、ImageNetにおけるResNetの性能を向上させる自己教師あり表現学習手法ReLIC v2を提案する。明著なマスキング、マルチスケールのデータ拡張、およびコントラスト型不変性目的関数を組み合わせることで、ReLIC v2は線形評価下でResNet50で77.1%のトップ1精度を達成し、教師あり学習を上回り、ラベルなし自己教師あり学習の新たな最良成績を樹立した。

ABSTRACT

Despite recent progress made by self-supervised methods in representation learning with residual networks, they still underperform supervised learning on the ImageNet classification benchmark, limiting their applicability in performance-critical settings. Building on prior theoretical insights from ReLIC [Mitrovic et al., 2021], we include additional inductive biases into self-supervised learning. We propose a new self-supervised representation learning method, ReLICv2, which combines an explicit invariance loss with a contrastive objective over a varied set of appropriately constructed data views to avoid learning spurious correlations and obtain more informative representations. ReLICv2 achieves $77.1\%$ top-$1$ accuracy on ImageNet under linear evaluation on a ResNet50, thus improving the previous state-of-the-art by absolute $+1.5\%$; on larger ResNet models, ReLICv2 achieves up to $80.6\%$ outperforming previous self-supervised approaches with margins up to $+2.3\%$. Most notably, ReLICv2 is the first unsupervised representation learning method to consistently outperform the supervised baseline in a like-for-like comparison over a range of ResNet architectures. Using ReLICv2, we also learn more robust and transferable representations that generalize better out-of-distribution than previous work, both on image classification and semantic segmentation. Finally, we show that despite using ResNet encoders, ReLICv2 is comparable to state-of-the-art self-supervised vision transformers.

研究の動機と目的

  • ラベルを一切使用せずに自己教師あり表現学習がImageNetで教師あり学習を上回れるかどうかを調査すること。
  • 背景やスタイルなどの誤った特徴に依存するのを減らすことで、コントラスト型自己教師あり手法の劣悪な性能を是正すること。
  • データ拡張とアーキテクチャの変更を通じて誘導的バイアスを導入することで、表現の質と一般化性能を向上させること。
  • 画像分類やセマンティックセグメンテーションなどの下流タスクにおいて、学習された表現の頑健性と転送可能性を評価すること。
  • ラベルなしで自己教師ありResNetが、視覚変換器(Vision Transformers)と同等またはそれ以上の性能を達成できるかどうかを検証すること。

提案手法

  • ReLICに基づく自己教師あり学習フレームワークの拡張版として、コントラスト損失と不変性損失を組み合わせたReLIC v2を導入する。
  • 完全に非教師ありの明著マスキングパイプラインを採用し、前景と背景を分離することで、誤った背景特徴への依存を低減する。
  • 大規模および小規模なクロップを用いたマルチスケールデータ拡張を適用し、遮蔽に対する頑健性を向上させ、特徴の不変性を強化する。
  • 訓練の安定化のため指数移動平均(EMA)ターゲットネットワークを用い、感度分析により0.9から0.996のEMA減衰率の範囲で性能が安定していることが示された。
  • 訓練中に明著マスクをランダムにマスキングすることで一般化性能を向上させ、中程度の損傷があっても性能が安定していることが確認された。
  • ミニバッチからランダムサブサンプリングによりネガティブ例を選択し、誤ったネガティブ例を回避する。最適な性能は10個のネガティブ例で達成された。

実験結果

リサーチクエスチョン

  • RQ1ラベルなしで自己教師あり表現学習が、ImageNetで教師あり学習を上回れるか?
  • RQ2背景やスタイルのような誤った特徴を抑えることで、自己教師あり学習における表現品質が向上するか?
  • RQ3マルチスケールデータ拡張は、自己教師ありResNetにおける頑健性と一般化性能にどのように影響するか?
  • RQ4自己教師ありResNetは、ラベルなしで最先端の視覚変換器と同等の性能を達成できるか?
  • RQ5EMA減衰率やネガティブ例の数といったハイパーパrameterに、ReLIC v2はどれほど感受性を示すか?

主な発見

  • ReLIC v2は、線形評価下でResNet50を用いてImageNetで77.1%のトップ1精度を達成し、以前の自己教師あり学習の最良成績を+1.5%上回った。
  • より大きなResNetモデルでは、ReLIC v2は最大で80.6%のトップ1精度に達し、以前の自己教師あり手法を最大+2.3%上回った。
  • ReLIC v2は、複数のResNetアーキテクチャにわたる同等の比較において、自己教師あり学習で教師あり学習を一貫して上回った最初の手法である。
  • 分布外でも他の研究より優れた一般化性能を示し、画像分類およびセマンティックセグメンテーションの両方で頑健性が向上した。
  • マスクに損傷(例:長方形の追加)があっても、ReLIC v2は強力な性能(トップ1精度74.5%)を維持しており、マスクの不完全さに対する頑健性を示した。
  • ハイパーパrameterの選択に対して頑健である:EMA減衰率が0.9から0.996の範囲であれば、性能に大きな差がなく、最適なネガティブサンプリングは10個のネガティブ例で達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。