Skip to main content
QUICK REVIEW

[論文レビュー] Instance Localization for Self-supervised Detection Pretraining

Ceyuan Yang, Zhirong Wu|arXiv (Cornell University)|Feb 16, 2021
Domain Adaptation and Few-Shot Learning参考文献 43被引用数 8
ひとこと要約

本稿では、物体検出の転移性能を向上させるために、事前学習中にバウンディングボックスアノテーションを統合する自己教師ありプロメイトタスクであるインスタンスロケーション(InsLoc)を提案する。背景画像にさまざまなスケールおよび位置にオブジェクトインスタンスを貼り付け、そのインスタンスのカテゴリをバウンディングボックスのガイダンスとともに予測するようにモデルを学習させることで、検出タスクに適した特徴の整合性が向上し、PASCAL VOCおよびCOCOで最先端の結果を達成している。特にデータ量が少ない状況下でも顕著な性能向上が見られる。

ABSTRACT

Prior research on self-supervised learning has led to considerable progress on image classification, but often with degraded transfer performance on object detection. The objective of this paper is to advance self-supervised pretrained models specifically for object detection. Based on the inherent difference between classification and detection, we propose a new self-supervised pretext task, called instance localization. Image instances are pasted at various locations and scales onto background images. The pretext task is to predict the instance category given the composited images as well as the foreground bounding boxes. We show that integration of bounding boxes into pretraining promotes better task alignment and architecture alignment for transfer learning. In addition, we propose an augmentation method on the bounding boxes to further enhance the feature alignment. As a result, our model becomes weaker at Imagenet semantic classification but stronger at image patch localization, with an overall stronger pretrained model for object detection. Experimental results demonstrate that our approach yields state-of-the-art transfer learning results for object detection on PASCAL VOC and MSCOCO.

研究の動機と目的

  • 自己教師ありの画像分類用事前学習と、下流の物体検出タスクとの間にある特徴の不整合を是正すること。
  • 空間的局在化の要件に合わせて事前学習タスクを調整することで、物体検出の転移学習性能を向上させること。
  • 自己教師あり事前学習中にバウンディングボックスの監視情報を組み込むことで、特徴の整合性と検出の汎化性能が向上するかどうかを検証すること。
  • バウンディングボックスに空間的なジッターアーギュメンテーションを適用することで、表現学習の質が向上するかを評価すること。
  • ImageNet分類精度を犠牲にすることで、タスクとアーキテクチャの整合性が高まり、検出性能が向上することを示すこと。

提案手法

  • さまざまなスケール、アスペクト比、位置にオブジェクトインスタンス(フォアグラウンドクロップ)を背景画像に貼り付けることで、合成された訓練画像を作成する。
  • モデルは、真のバウンディングボックスを用いてRoIAlignで抽出された領域の特徴(RoI特徴)に対して、対照的学習(contrastive learning)を用いて学習する。
  • プロメイトタスクは、合成画像とその対応するバウンディングボックスからインスタンスのカテゴリを予測することであり、空間的認識可能な表現学習を促進する。
  • 空間的なジッターアーギュメンテーションを、バウンディングボックスの領域提案アーキテクチャの集合からサンプリングすることで適用し、特徴のロバスト性と整合性を向上させる。
  • 本手法はMoCo-v2フレームワークに実装されており、自己教師あり学習にモーメンタム対照(momentum contrast)を用いている。
  • 下流の検出モデルと同一のバックボーン(例:ResNet50-C4 または ResNet50-FPN)を用いることで、転移時のアーキテクチャの一貫性を維持する。

実験結果

リサーチクエスチョン

  • RQ1自己教師あり事前学習にバウンディングボックスアノテーションを統合することで、物体検出の転移性能が向上するか?
  • RQ2全体像の分類ではなく、局在化に重点を置いたプロメイトタスクが、より優れた検出汎化性能をもたらすか?
  • RQ3事前学習段階でバウンディングボックスに空間的ジッターを適用することで、特徴の整合性と検出性能にどのような影響を与えるか?
  • RQ4本手法は、低ショット検出転移設定において、より優れたデータ効率性を達成するか?
  • RQ5分類精度と検出性能のトレードオフが、自己教師あり学習におけるタスク整合性の重要性をどの程度裏付けるか?

主な発見

  • 提案手法のインスタンスロケーションは、R50-C4を用いてCOCOで41.1 AP bbを達成し、MoCo-v2を+1.3 AP bb上回った。
  • バウンディングボックスに空間的ジッターを適用した場合、性能はさらに向上し、41.4 AP bbに到達した。これにより、アーギュメンテーション戦略の有効性が裏付けられた。
  • Mini COCO(COCOの学習データの10%)では、26.0 AP bb および 23.5 AP mk を達成し、MoCo-v2をそれぞれ3.3 AP bb および 2.4 AP mk 上回った。
  • ImageNet線形プローブ精度はベースラインモデルより低いものの、パッチの局在化性能が高く、検出に特化した特徴とより良い整合性を示した。
  • 長期間の事前学習(400エポック)により検出性能が向上し、短い学習スケジュールよりも一貫した向上が見られた。これは、長期間の事前学習が検出タスクへの転移に有益であることを示している。
  • 長いファインチューニングスケジュール(例:2倍 vs 1倍)でも、事前学習モデルの相対的な性能向上が維持されており、ロバスト性と強い転送性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。