Skip to main content
QUICK REVIEW

[論文レビュー] Distilling Localization for Self-Supervised Representation Learning

Nanxuan Zhao, Zhirong Wu|arXiv (Cornell University)|Apr 14, 2020
Visual Attention and Saliency Detection参考文献 54被引用数 11
ひとこと要約

本論文は、背景に依存しない増幅を介して前景オブジェクトの局在化を蒸留することで、自己教師あり対照的学習を向上させるデータ駆動型手法DiLoを提案する。類似度マスクを推定し、多様な背景に前景をコピー&ペーストすることで増幅を生成することで、表現学習を強化し、ImageNet分類およびPASCAL VOCやCOCOといったオブジェクト検出ベンチマークで最先端の転移性能を達成し、精度向上が最大6%にのぼる。

ABSTRACT

Recent progress in contrastive learning has revolutionized unsupervised representation learning. Concretely, multiple views (augmentations) from the same image are encouraged to map to the similar embeddings, while views from different images are pulled apart. In this paper, through visualizing and diagnosing classification errors, we observe that current contrastive models are ineffective at localizing the foreground object, limiting their ability to extract discriminative high-level features. This is due to the fact that view generation process considers pixels in an image uniformly. To address this problem, we propose a data-driven approach for learning invariance to backgrounds. It first estimates foreground saliency in images and then creates augmentations by copy-and-pasting the foreground onto a variety of backgrounds. The learning still follows the instance discrimination pretext task, so that the representation is trained to disregard background content and focus on the foreground. We study a variety of saliency estimation methods, and find that most methods lead to improvements for contrastive learning. With this approach (DiLo), significant performance is achieved for self-supervised learning on ImageNet classification, and also for object detection on PASCAL VOC and MSCOCO.

研究の動機と目的

  • 自己教師あり対照的モデルが分類性能に優れているにもかかわらず、なぜ前景オブジェクトを局在化できないのかを診断すること。
  • 現在の対照的学習が画像の領域を均等に扱うという制限を是正することにより、モデルが背景の手がかりに依存するのを防ぐこと。
  • 背景の変化に対して不変な表現を学習するように促すデータ駆動型の増幅戦略を開発すること。
  • より優れた局在化により特徴の識別性を高めることで、オブジェクト検出などの下流タスクにおける転移学習性能を向上させること。
  • さまざまな類似度推定手法がこの局在化蒸留プロセスを支援する上で、性能に与える影響を評価すること。

提案手法

  • 本手法は、無教師または学習された類似度モデル(例:RBD、BasNet)を用いて、訓練画像の前景類似度マスクを推定する。
  • 類似度マスクに基づき、多様な背景画像に前景オブジェクトをコピー&ペーストすることでデータ増幅を生成し、オブジェクトの同一性を保持しながら文脈を変化させる。
  • 得られた増幅画像ペアを、標準的なインスタンス識別プロキシタスクに使用し、モデルが背景の変化に対して不変な表現を学習するように促進する。
  • 本手法はプラグアンドプレイであり、MoCo、CMC、InstDistなどの既存の対照的学習フレームワークと互換性がある。
  • 類似度推定は画像ごとに行い、その結果得られた増幅ペアを対照的学習目的関数に供給し、バックボーンネットワークを学習する。
  • 本手法は複数の自己教師あり学習ベースラインおよび下流タスク(ImageNet分類、VOCおよびCOCOにおけるオブジェクト検出)を対象に評価されている。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり対照的モデルが分類精度に優れているにもかかわらず、なぜ前景オブジェクトを局在化できないのか?
  • RQ2データ増幅による前景局在化の向上が、自己教師あり表現学習を強化できるか?
  • RQ3さまざまな類似度推定手法の性能が、局在化および転移精度の観点で対照的学習に与える影響は何か?
  • RQ4背景コンテンツに対する不変性を学習することで、下流の検出および分類タスクにおける一般化性能が向上するか?
  • RQ5本手法は既存の対照的学習技術と直交しているか、それともアーキテクチャの変更を要するか?

主な発見

  • DiLoは、ImageNet線形評価においてベースラインの対照的学習手法を2%~6%上回る一貫した向上を達成し、特に学習された類似度(BasNet)を用いた場合に最も顕著な向上が見られた。
  • PASCAL VOCオブジェクト検出では、DiLo-BasNetが56.9% APを達成し、MoCoベースライン(55.9%)を上回り、AP_{75}においても教師ありImageNet事前学習を5.3ポイント上回った。
  • MSCOCOでは、DiLo-BasNetが40.1% AP^{bb}および39.0% AP^{mk}_{75}を達成し、MoCoベースライン(39.4%および38.0%)を上回り、AP^{mk}_{75}で0.7%の向上を示した。
  • 可視化結果から、DiLoは判別性の高いオブジェクト領域に注目しているのに対し、ベースラインは背景の内容に引き寄せられることが確認され、局在化の向上が妥当であることが裏付けられた。
  • 本手法はMoCo-v1、MoCo-v2、CMC、InstDistなど複数の対照的学習フレームワークで有効であることが示され、直交性と広範な適用可能性を確認した。
  • 失敗事例は主に複数オブジェクトが存在するシーンや細分化されたカテゴリに起因しており、複雑な視覚的条件下での類似度推定の限界と一般化の難しさを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。