Skip to main content
QUICK REVIEW

[論文レビュー] Self-Supervised Ranking for Representation Learning

Ali Varamesh, Ali Diba|arXiv (Cornell University)|Oct 14, 2020
Domain Adaptation and Few-Shot Learning参考文献 19被引用数 5
ひとこと要約

本論文は、複数のランダムな画像増幅の間でグローバルランキング問題として表現学習を定式化する自己教師あり表現学習フレームワークS2R2を提案する。対照的学習手法(例:SimCLR や SwAV)よりも、MS-COCO などの多様なデータセット、特にごみくずだらけでキュレートされていないシーンで優れた性能を発揮する。これは、ペairワイズな対照的損失に依存するのではなく、すべてのビューにおける平均適合率(AP)を最適化することによって達成される。

ABSTRACT

We present a new framework for self-supervised representation learning by formulating it as a ranking problem in an image retrieval context on a large number of random views (augmentations) obtained from images. Our work is based on two intuitions: first, a good representation of images must yield a high-quality image ranking in a retrieval task; second, we would expect random views of an image to be ranked closer to a reference view of that image than random views of other images. Hence, we model representation learning as a learning to rank problem for image retrieval. We train a representation encoder by maximizing average precision (AP) for ranking, where random views of an image are considered positively related, and that of the other images considered negatives. The new framework, dubbed S2R2, enables computing a global objective on multiple views, compared to the local objective in the popular contrastive learning framework, which is calculated on pairs of views. In principle, by using a ranking criterion, we eliminate reliance on object-centric curated datasets. When trained on STL10 and MS-COCO, S2R2 outperforms SimCLR and the clustering-based contrastive learning model, SwAV, while being much simpler both conceptually and at implementation. On MS-COCO, S2R2 outperforms both SwAV and SimCLR with a larger margin than on STl10. This indicates that S2R2 is more effective on diverse scenes and could eliminate the need for an object-centric large training dataset for self-supervised representation learning.

研究の動機と目的

  • 局所的ペアワイズ対照的学習目的の限界、特に視覚的多様性やごみくずだらけのシーンで困難をきたす点を解決すること。
  • オブジェクト中心のキュレート済みデータセットに依存しないように、同じ画像の複数のランダムなビューを用いたグローバルランク付け問題として表現学習を定式化すること。
  • ローカルな対照的損失ではなく、グローバル平均適合率(AP)目的関数を用いることで最適化の安定性と性能を向上させること。
  • ランク付けベースの自己教師あり学習が、キュレートされていない複雑なデータセット(例:MS-COCO)において対照的学習よりも一般化性能に優れていることを示すこと。
  • 複雑なマルチステージトレーニングやクラスタリングを必要としない、より単純なグローバルランク付け目的関数が、最先端の対照的モデルを上回ることを検証すること。

提案手法

  • フレームワークは、同じ画像のランダムな増幅をポジティブサンプルとし、他の画像からの増幅をネガティブサンプルとする検索タスクとして表現学習を扱う。
  • ミニバッチ内のすべてのポジティブおよびネガティブビューにおける平均適合率(AP)を最適化し、表現ベクトル間のコサイン類似度を用いてランクスコアを計算する。
  • AP式におけるインジケータ関数の微分可能な近似に基づく損失関数を用い、バックプロパゲーションによるエンドツーエンド学習を可能にする。
  • エンコーダー特徴量に非線形なプロジェクションヘッドを適用し、固定された1e-4の初期学習率を用いてADAMでスクラッチからモデルを訓練する。
  • 全データセットで96×96のランダムクロップを用い、ResNet18およびResNet50をバックボーンとして使用し、下流分類タスクにおける線形プローブ精度を評価する。
  • 本手法は、SimCLR や SwAV が行うインスタンスレベルのラベルやクラスタ割り当てを必要とせず、ビュー間の相対的ランク付けにのみ依存する。

実験結果

リサーチクエスチョン

  • RQ1複数の画像増幅に対するグローバルランク付け目的関数は、自己教師あり表現学習における局所的ペアワイズ対照的学習を上回ることができるか?
  • RQ2提案されたランク付けベースの手法は、キュレートされていない多様なデータセット(例:MS-COCO)において、対照的学習よりも一般化性能に優れているか?
  • RQ3S2R2の性能は、異なるデータセットおよびバックボーンアーキテクチャにおいて、最先端の対照的モデル(例:SimCLR や SwAV)と比較してどうなるか?
  • RQ4ミニバッチサイズや1枚の画像あたりのビュー数が、ランク付けベースの目的関数の性能に与える影響は何か?
  • RQ5ランク付け目的関数は、ペアワイズ対照的学習に内在する最適化の矛盾(例:ポジティブペアに対する矛盾する引き寄せ力)を緩和するか?

主な発見

  • MS-COCO-Train および MS-COCO-Val において、S2R2はResNet50を用いてそれぞれ81.2%および70.2%のトップ1線形分類精度を達成し、それぞれSimCLR(74.9%および59.4%)およびSwAV(77.5%および59.4%)を上回った。
  • STL10では、200エポックでS2R2が89.7%の精度を達成し、同じ設定下でSimCLR(85.2%)およびSwAV(85.9%)を上回った。
  • S2R2はCOCO-ValでSwAVよりも高速に収束し、長時間のトレーニングでも性能が安定または向上する一方、SwAVは長時間スケジュールで性能が低下した。
  • ミニバッチに含める画像数を閾値を超えて増やすと性能が低下し、おそらく画像間の視覚的類似性が増加することでランク信号が弱まるためと推測される。
  • S2R2はMS-COCOではSTL10よりも大きな性能向上幅を示しており、複雑でキュレートされていないシーンにおける優れた性能を示している。
  • クラスタ割り当てやインスタンスレベルのラベルを一切必要とせず、最先端の性能を達成した。これはグローバルランク付け目的関数の有効性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。