Skip to main content
QUICK REVIEW

[論文レビュー] Self-taught Object Localization with Deep Networks

Loris Bazzani, Alessandro Bergamo|arXiv (Cornell University)|Sep 13, 2014
Advanced Neural Network Applications参考文献 36被引用数 16
ひとこと要約

本論文では、人為的バウンディングボックスのラベルが一切不要な、自己学習型オブジェクト局在化の手法を提案する。事前に学習された深層畳み込みニューラルネットワークを用い、領域を段階的にマスクして認識スコアの低下を測定することで、階層的クラスタリングによりオブジェクトの位置を同定する。ILSVRC-2012で最先端手法と比較してトップ-1リCALLで23.4%の相対的改善を達成し、検出器の学習に使用可能な高品質な提案領域を生成する。

ABSTRACT

This paper introduces self-taught object localization, a novel approach that leverages deep convolutional networks trained for whole-image recognition to localize objects in images without additional human supervision, i.e., without using any ground-truth bounding boxes for training. The key idea is to analyze the change in the recognition scores when artificially masking out different regions of the image. The masking out of a region that includes the object typically causes a significant drop in recognition score. This idea is embedded into an agglomerative clustering technique that generates self-taught localization hypotheses. Our object localization scheme outperforms existing proposal methods in both precision and recall for small number of subwindow proposals (e.g., on ILSVRC-2012 it produces a relative gain of 23.4% over the state-of-the-art for top-1 hypothesis). Furthermore, our experiments show that the annotations automatically-generated by our method can be used to train object detectors yielding recognition results remarkably close to those obtained by training on manually-annotated bounding boxes.

研究の動機と目的

  • 人為的バウンディングボックスのラベルを一切必要とせず、画像レベルのクラスラベルのみを用いてオブジェクト局在化を実現する手法の開発。
  • 領域マスクによる認識スコアの変化を分析することで、事前に学習された深層ネットワークを活用し、弱教師付き局在化を実現する。
  • 手動ラベルなしで正確なオブジェクト検出器を学習できる、高品質なオブジェクト提案領域を生成すること。
  • PASCAL VOC 2007などの異なるデータセットにおける一般化性能を評価すること。

提案手法

  • 事前に学習されたImageNet分類器を用いて、画像の異なる領域を意図的にマスクアウトした際の認識スコアの変化を分析する。
  • マスクアウトした際に顕著なスコア低下を示す領域は、オブジェクトを含む可能性が高いとみなす。
  • 認識スコアの相対的低下に基づいて画像領域を凝集的クラスタリングし、階層的なサブウィンドウ提案を形成する。
  • マルチスケールでボトムアップな領域提案戦略と、深層ネットワークからのトップダウン的識別フィードバックを組み合わせる。
  • すべてのマスク領域において認識スコアが最大に低下する領域を、最終的な局在化仮説として選択する。
  • ラベルの曖昧さに強く、たとえ利用可能なのはトップ予測クラスのみであっても、正常に動作可能である。

実験結果

リサーチクエスチョン

  • RQ1画像レベルのラベルのみでバウンディングボックスのラベルが一切不要なオブジェクト局在化が可能か?
  • RQ2領域マスクに対する認識スコアの感受性は、オブジェクト位置の同定にどの程度有効か?
  • RQ3本手法で自動生成された提案領域は、手動ラベル付きデータで学習した検出器と同等の性能を達成できる検出器を学習できるか?
  • RQ4本手法は、異なるデータセットやオブジェクトカテゴリにわたって一般化できるか?

主な発見

  • 本手法は、ILSVRC-2012データセットにおいて、最先端手法と比較してトップ-1リCALLで23.4%の相対的改善を達成した。
  • 提案領域数が少ない場合(例:1~100)において、精度とリCALLの両面で既存のオブジェクトネス手法を上回った。
  • 本手法で自動生成されたサブウィンドウは、手動ラベル付きバウンディングボックスで学習した検出器と同等に高い認識性能を達成する検出器の学習に使用可能である。
  • 本手法はPASCAL VOC 2007データセットに対しても良好に一般化され、異なるオブジェクトカテゴリやデータセット間での移行性を示した。
  • 複数の類似オブジェクト(例:複数のイヌ)が存在する場合でも、すべてのインスタンスを正しくグループ化できており、それらを同時にマスクすると認識スコアが最大に低下することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。