Skip to main content
QUICK REVIEW

[論文レビュー] Delving into Inter-Image Invariance for Unsupervised Visual Representations

Jiahao Xie, Xiaohang Zhan|arXiv (Cornell University)|Aug 26, 2020
Domain Adaptation and Few-Shot Learning被引用数 15
ひとこと要約

本稿では、画像内および画像間の不変性を統合した自己教師付き視覚表現学習の統合フレームワーク、InterCLRを提案する。疑似ラベルの維持、サンプリング戦略、意思決定境界の設計について体系的な検討を行い、画像間不変性—意味的に類似した画像間の類似性を学習すること—が、最先端の画像内不変性手法を大きく上回る性能を発揮することを示した。少ない訓練エポック数と低い計算コストで標準ベンチマークで最先端の結果を達成した。

ABSTRACT

Contrastive learning has recently shown immense potential in unsupervised visual representation learning. Existing studies in this track mainly focus on intra-image invariance learning. The learning typically uses rich intra-image transformations to construct positive pairs and then maximizes agreement using a contrastive loss. The merits of inter-image invariance, conversely, remain much less explored. One major obstacle to exploit inter-image invariance is that it is unclear how to reliably construct inter-image positive pairs, and further derive effective supervision from them since no pair annotations are available. In this work, we present a comprehensive empirical study to better understand the role of inter-image invariance learning from three main constituting components: pseudo-label maintenance, sampling strategy, and decision boundary design. To facilitate the study, we introduce a unified and generic framework that supports the integration of unsupervised intra- and inter-image invariance learning. Through carefully-designed comparisons and analysis, multiple valuable observations are revealed: 1) online labels converge faster and perform better than offline labels; 2) semi-hard negative samples are more reliable and unbiased than hard negative samples; 3) a less stringent decision boundary is more favorable for inter-image invariance learning. With all the obtained recipes, our final model, namely InterCLR, shows consistent improvements over state-of-the-art intra-image invariance learning methods on multiple standard benchmarks. We hope this work will provide useful experience for devising effective unsupervised inter-image invariance learning. Code: https://github.com/open-mmlab/mmselfsup.

研究の動機と目的

  • 画像内不変性と比較して未だあまり検討が進んでいない画像間不変性の潜在的価値を解明すること。
  • 人為的ラベルなしで信頼できる画像間ポジティブペアを構築する課題に、特に訓練中の疑似ラベルの不安定性を理由に取り組むこと。
  • 効果的な画像間不変性学習を可能にする最適な設計選択肢—疑似ラベルの維持、サンプリング戦略、意思決定境界—を同定すること。
  • 画像内および画像間不変性をシームレスに統合する統合フレームワーク、InterCLRを構築すること。
  • 画像間不変性学習が、大規模な事前学習や高コストな計算リソースを必要としなくても、最先端の画像内不変性手法と同等またはそれ以上の性能向上をもたらすかどうかを実証すること。

提案手法

  • 共通の特徴空間内でコントラスト学習を用いて画像内および画像間不変性を同時に最適化する統合フレームワーク、InterCLRを導入する。
  • ラベルの陳腐化を低減するために、スパースなグローバルクラスタリングに代わって、オンラインミニバッチk-meansを用いて最新の疑似ラベルを維持する。
  • 誤ってラベル付けされたネガティブ例を避け、訓練の安定性と性能を向上させるために、準ハードネガティブサンプリング戦略を採用する。
  • 対照損失における意思決定境界を緩めることで、ノイズの多い疑似ラベルに対してもより頑健な特徴学習を可能にする。
  • 学習された特徴を用いてインスタンスレベルの類似度を活用し、同じクラスの異なるインスタンス間で画像間ポジティブペアを形成することで、意味的不変性を学習可能にする。
  • 同一画像の増強画像間の類似性(画像内)と、意味的に類似した画像間の類似性(画像間)を促進する対照損失を適用するとともに、類似しないペairを分離する。

実験結果

リサーチクエスチョン

  • RQ1オンライン疑似ラベル維持とオフラインまたはグローバルクラスタリングの比較において、画像間不変性学習の性能と安定性にどのような差が生じるか?
  • RQ2ノイズの多い疑似ラベル下で、画像間コントラスト学習に最も効果的で信頼性の高いサンプリング戦略は、ハード、準ハード、ランダム、またはイージーネガティブのどれか?
  • RQ3対照損失における意思決定境界の選択が、画像間不変性学習の一般化性能と頑健性に与える影響は?
  • RQ4適切に設計された画像間不変性学習は、標準ベンチマークで最先端の画像内不変性手法を一貫して上回る性能を発揮できるか?
  • RQ5画像間不変性学習は、大規模な事前学習と高い計算コストを要するプロトコルをどれだけ低減できるか?

主な発見

  • ミニバッチk-meansによるオンライン疑似ラベル維持は、ラベルの陳腐化が少ないため、オフラインまたはグローバルクラスタリングよりも収束が速く、性能が優れている。
  • 準ハードネガティブサンプリングは、誤った疑似ラベルによる誤ったポジティブ例を多く含むハードネガティブサンプリングに比べ、より信頼性が高く偏りのない勾配を生成する。
  • 対照損失における緩められた意思決定境界は、ノイズの多いまたは誤った画像間ペアに過剰適合するのを防ぎ、一般化性能と性能を向上させる。
  • ImageNetを含む複数の標準ベンチマークで、SimCLR、SwAV、BYOLといった最先端の画像内不変性手法を上回る一貫した性能向上を実現した。
  • 非常に大きなバッチサイズと長時間の事前学習スケジュールを必要としていた先行SOTA手法と比較して、InterCLRは同等またはそれ以上の性能を達成したが、はるかに高い訓練効率を示した。
  • KNN検索の結果、10番目の近傍でさえも、画像内のみのベースラインと比較して、より多くの正しい近傍を高いコサイン類似度で検索できた。これは、画像間不変性の有効性を裏付けるものである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。