Skip to main content
QUICK REVIEW

[論文レビュー] Can Semantic Labels Assist Self-Supervised Visual Representation Learning?

Longhui Wei, Lingxi Xie|arXiv (Cornell University)|Nov 17, 2020
Domain Adaptation and Few-Shot Learning被引用数 9
ひとこと要約

この論文は、視覚的表現の転送を向上させるために、対照学習に意味的ラベルを統合する新しい自己教師あり学習手法であるSupervised Contrastive Adjustment in Neighborhood (SCAN)を提案する。対照学習の過程で、意味的および外観的に類似した近隣をポジティブ例として保持することで、下流の検出およびセグメンテーションタスクで最先端の性能を達成し、完全に教師ありおよび自己教師ありのベースラインを上回っている。特に、COCOオブジェクト検出では1.7%のAP向上を達成している。

ABSTRACT

Recently, contrastive learning has largely advanced the progress of unsupervised visual representation learning. Pre-trained on ImageNet, some self-supervised algorithms reported higher transfer learning performance compared to fully-supervised methods, seeming to deliver the message that human labels hardly contribute to learning transferrable visual features. In this paper, we defend the usefulness of semantic labels but point out that fully-supervised and self-supervised methods are pursuing different kinds of features. To alleviate this issue, we present a new algorithm named Supervised Contrastive Adjustment in Neighborhood (SCAN) that maximally prevents the semantic guidance from damaging the appearance feature embedding. In a series of downstream tasks, SCAN achieves superior performance compared to previous fully-supervised and self-supervised methods, and sometimes the gain is significant. More importantly, our study reveals that semantic labels are useful in assisting self-supervised methods, opening a new direction for the community.

研究の動機と目的

  • 対照学習の成功にもかかわらず、意味的ラベルが自己教師あり視覚表現学習に意味的に寄与できるかどうかを調査すること。
  • 教師あり学習から得られるタスク固有の意味的特徴と、自己教師あり学習から得られるタスクに依存しない外観特徴の間にある矛盾を解消すること。
  • 一般化性能や性能を損なわずに、意味的ガイドラインと対照学習を効果的に統合する手法を設計すること。
  • 適切に意味的ラベルを活用することで、下流タスクにおける転移性能が著しく向上することを実証すること。

提案手法

  • SCANは、同じクラスのすべての画像をポジティブ例としないで、クエリ画像と意味的および外観的に類似したもののみをポジティブ例として定義することで、対照学習の目的関数を変更する。
  • 自己教師あり対照学習(例:MoCo-v2)から事前学習済みモデルを引き継ぎ、各クエリ画像の近隣を意味的におよび視覚的に類似したインスタンスに再定義する。
  • 意味的および視覚的に類似したセット(例:埋め込み空間およびラベル空間で上位K個の類似度が高いもの)をポジティブ近隣として保持し、それ以外のものをすべてネガティブとみなす。
  • 対照損失を調整し、クエリとそのポジティブ近隣を近づける一方で、他のすべてのネガティブ例を遠ざけることで、外観一般化を損なわずに意味的識別能を向上させる。
  • 既存の対照学習フレームワークに最小限のコード変更で実装可能であり、容易に採用可能である。
  • 線形評価(ImageNet-1K)および微調整(COCO、VOC、Cityscapes)を通じて、検出およびセグメンテーションタスクで評価される。

実験結果

リサーチクエスチョン

  • RQ1適切に統合された場合、意味的ラベルは自己教師あり視覚表現学習を改善できるか?
  • RQ2意味的教師あり情報と対照学習を組み合わせることで、純粋な自己教師ありまたは完全に教師ありの手法よりも優れた転移性能が得られるか?
  • RQ3意味的特徴と外観特徴を統合することで、オブジェクト検出やインスタンスセグメンテーションなどの下流タスクでの性能にどのような影響を与えるか?
  • RQ4ポジティブ近隣の数を変化させた場合、モデルの一般化性能および性能にどのような影響があるか?

主な発見

  • VOC検出では83.3%のAP50、VOCセグメンテーションでは76.6%のmIoUを達成し、完全に教師ありおよび自己教師ありのベースラインを上回っている。
  • COCOでは、APbbをMoCo-v2の39.2%から40.9%に向上させ、オブジェクト検出で顕著な向上を示している。
  • インスタンスセグメンテーションでは、COCOで37.2%のAPmkを達成し、MoCo-v2のそれ(35.7%)より1.5%向上している。
  • Cityscapesでは、セマンティックセグメンテーションで76.5%のmIoUを達成し、MoCo-v2の75.2%を上回っている。
  • ImageNet-1Kにおける線形評価では、SCANは75.0%のTop-1精度を達成し、MoCo-v2のそれ(71.1%)より3.9%向上している。
  • 分析の結果、小および中サイズのオブジェクトの検出性能が向上(APbbS: 24.3 vs. 23.8、APbbM: 46.7 vs. 45.6)しており、意味的識別能の向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。