[論文レビュー] With a Little Help from My Friends: Nearest-Neighbor Contrastive Learning of Visual Representations
本論文では、データ拡張によるビューではなく、学習された埋め込み空間からの最近傍を正例ペアとして使用する自己教師あり対照学習手法NNCLRを提案する。データセット内の意味的に類似した例を活用することで、表現学習を向上させ、ImageNet線形評価でトップ1正解率75.6%を達成。これは先行する最先端手法を上回り、複雑なデータ拡張への依存を低減する。
Self-supervised learning algorithms based on instance discrimination train encoders to be invariant to pre-defined transformations of the same instance. While most methods treat different views of the same image as positives for a contrastive loss, we are interested in using positives from other instances in the dataset. Our method, Nearest-Neighbor Contrastive Learning of visual Representations (NNCLR), samples the nearest neighbors from the dataset in the latent space, and treats them as positives. This provides more semantic variations than pre-defined transformations. We find that using the nearest-neighbor as positive in contrastive losses improves performance significantly on ImageNet classification, from 71.7% to 75.6%, outperforming previous state-of-the-art methods. On semi-supervised learning benchmarks we improve performance significantly when only 1% ImageNet labels are available, from 53.8% to 56.5%. On transfer learning benchmarks our method outperforms state-of-the-art methods (including supervised learning with ImageNet) on 8 out of 12 downstream datasets. Furthermore, we demonstrate empirically that our method is less reliant on complex data augmentations. We see a relative reduction of only 2.1% ImageNet Top-1 accuracy when we train using only random crops.
研究の動機と目的
- 単一ビューの正例を用いたインスタンス識別を超えて、自己教師あり視覚表現学習を改善すること。
- 対照学習における複雑なデータ拡張戦略への依存を減らすために、意味的に有意義なクロスサンプル正例を用いること。
- 埋め込み空間における最近傍が、クラス内変動を捉える有効で多様な正例として機能するかどうかを検証すること。
- このような手法が、下流の転移タスクにおいて自己教師ありおよび監視付き事前学習を上回ることを示すこと。
提案手法
- 訓練データのサブセットからの固定された埋め込みのサポートセットを用い、訓練中に更新することで動的メモリとしての特徴を維持する。
- 各入力画像に対して、コサイン類似度を用いて潜在空間における最近傍を検索し、それらを正例ペアとして扱う。
- 同じ画像の拡張ビューと、サポートセットからの最近傍との間で対照損失を適用し、特徴の類似性を促進する。
- サポートセットはメモリバンクやキューとは異なり、負例の保存ではなく正例の近傍検索に使用される点が特徴である。
- エンコーダーはモーメンタム更新を施し、予測ヘッドを備えたモデルを訓練するが、正例ペアの供給方法を除きSimCLRと同様の構造を採用する。
- 評価は、ImageNetにおける線形評価、1%ラベル付きの半教師あり学習、12の下流データセットにおける転移学習という複数の設定で実施する。
実験結果
リサーチクエスチョン
- RQ1対照学習において、データセットからの最近傍を正例ペアとして使用することで、標準的なデータ拡張によるビューに比べて表現品質が向上するか?
- RQ2NNCLRは、下流タスクにおける自己教師ありと監視付き事前学習の性能差を縮小するか?
- RQ3NNCLRは、複雑なデータ拡張戦略への依存をどの程度低減するか?
- RQ4最近傍の多様性(同じクラス、類似したテクスチャ、または文脈など)が学習と最終的な性能に与える影響はいかほどか?
- RQ5完全に非教師ありの最近傍選択戦略が、常に同じクラスの近傍を選ぶ教師ありオラクルに近い性能を達成できるか?
主な発見
- NNCLRはImageNet線形評価で75.6%のトップ1正解率を達成し、先行する最先端手法より3.9%、SimCLRより3.8%の向上を示した。
- 1%のImageNetラベルのみを用いた半教師あり学習において、正解率を53.8%から56.5%まで向上させ、ラベルが乏しい状況下でも優れた一般化性能を示した。
- 12の下流転移学習ベンチマークのうち8つにおいて、最先端の自己教師ありおよび監視付きImageNet事前学習特徴を上回った。
- 色ずれやカットアウトなどの拡張を除き、ランダムクロップのみを用いた場合でも、73.3%のトップ1正解率を達成し、データ拡張への依存が2.1%相対的に低下していることが示された。
- 訓練終了時点で最近傍の正解率(同じImageNetクラス)は57%に達し、モデルが意味的に関連する例を適切に検索できるようになっていることが示された。
- 同じクラスの最近傍のみを使用するように強制したオラクル設定では、75.8%のトップ1正解率を達成し、より優れた近傍選択戦略によりさらなる性能向上が可能であることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。