Skip to main content
QUICK REVIEW

[論文レビュー] Exploit Bounding Box Annotations for Multi-label Object Recognition

Hao Yang, Joey Tianyi Zhou|arXiv (Cornell University)|Apr 22, 2015
Advanced Image and Video Retrieval Techniques参考文献 26被引用数 5
ひとこと要約

本論文は、畳み込みニューラルネットワーク(CNN)特徴量と正解バウンディングボックスアノテーションを活用して、最近傍関係を介してラベルビューを構築することで、マルチラベル物体認識を向上させるマルチビュー・マルチインスタンス学習フレームワークを提案する。このラベルビューを標準的なCNN特徴量と統合し、フィッシャー・ベクトル符号化を用いることで、PASCAL VOC 2007で92.0%、VOC 2012で90.1%のSOTA mAPを達成した。これは20のカテゴリのうち10のカテゴリからの部分的な強いラベルのみを用いても達成された。

ABSTRACT

Convolutional neural networks (CNNs) have shown great performance as general feature representations for object recognition applications. However, for multi-label images that contain multiple objects from different categories, scales and locations, global CNN features are not optimal. In this paper, we incorporate local information to enhance the feature discriminative power. In particular, we first extract object proposals from each image. With each image treated as a bag and object proposals extracted from it treated as instances, we transform the multi-label recognition problem into a multi-class multi-instance learning problem. Then, in addition to extracting the typical CNN feature representation from each proposal, we propose to make use of ground-truth bounding box annotations (strong labels) to add another level of local information by using nearest-neighbor relationships of local regions to form a multi-view pipeline. The proposed multi-view multi-instance framework utilizes both weak and strong labels effectively, and more importantly it has the generalization ability to even boost the performance of unseen categories by partial strong labels from other categories. Our framework is extensively compared with state-of-the-art hand-crafted feature based methods and CNN based methods on two multi-label benchmark datasets. The experimental results validate the discriminative power and the generalization ability of the proposed framework. With strong labels, our framework is able to achieve state-of-the-art results in both datasets.

研究の動機と目的

  • 複数の物体、スケールの変動、隠蔽があるマルチラベル画像におけるグローバルCNN特徴量の限界を解消すること。
  • 物体提案と正解バウンディングボックスからの強い教師信号を用いて、局所的情報を統合することで特徴量の識別力を向上させること。
  • 他のカテゴリからの部分的な強いラベルを用いて、未学習カテゴリへの一般化を可能にすること。
  • 弱い教師信号(画像レベルラベル)と強い教師信号(バウンディングボックスアノテーション)を効果的に統合するマルチインスタンス学習フレームワークの構築。
  • 全カテゴリのバウンディングボックスアノテーションを必要としないベンチマークマルチラベルデータセットでSOTA性能を達成すること。

提案手法

  • 各画像をバッグ、物体提案をインスタンスとして扱うことで、マルチラベル認識問題をマルチクラス・マルチインスタンス学習問題に変換する。
  • 各提案に対して2種類の特徴量を抽出する:標準的なCNN特徴量(特徴ビュー)と、正解バウンディングボックスへのk近傍関係に基づくラベルビュー。
  • ラベルの近接情報を符号化する局所的表現を学習するため、マージンを最大化する最近傍(LMNN)CNNを用いる。
  • フィッシャー・ベクトル符号化を用いて特徴ビューとラベルビューを統合し、包括的な画像レベル表現を生成する。
  • 弱い教師信号(画像レベルラベル)と強い教師信号(正解バウンディングボックス)を用いて、エンドツーエンドでモデルを学習し、局所的特徴量の学習をガイドする。
  • 標準的な8層CNNの代わりに16層の非常に深いCNNを用い、スケーラビリティと性能向上を評価する。また、事前学習モデルとスコア統合により性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1正解バウンディングボックスアノテーションを強いラベルとして組み込むことで、マルチラベル物体認識における特徴表現が向上するか?
  • RQ2特徴ビューとラベルビューを統合したマルチビューフレームワークは、識別力の向上と未学習カテゴリへの一般化を促進するか?
  • RQ3一部のカテゴリからの部分的な強いラベルが、残りの未学習カテゴリの認識性能を向上させるか?
  • RQ4提案されたマルチインスタンス学習フレームワークは、標準ベンチマーク上でのSOTAハンドクラフトおよびCNNベース手法と比較してどのように評価されるか?
  • RQ5バッグベースのマルチインスタンス学習設定において、フィッシャー・ベクトル符号化は、マックスプーリングに比べてどの程度優れているか?

主な発見

  • 提案フレームワークは、PASCAL VOC 2007で92.0%というSOTA mAPを達成し、既存の最良手法をほぼ1%上回った。
  • 20のカテゴリのうち10のカテゴリでのみ正解バウンディングボックスが利用可能であったが、ベースライン比でmAPが1.3%向上し、未学習カテゴリへの一般化能力が顕著に示された。
  • ラベルビューは顕著な貢献を示した:20のカテゴリすべてを用いた場合、特徴ビューにラベルビューを追加することでmAPが2.5%向上した。
  • 8層CNNを16層の非常に深いCNNに置き換えることで、「VeryDeep」モデルと同等の性能が得られ、両モデルの統合により、92.0%という新たなSOTA mAPを達成した。
  • VOC 2012では、SOTAハンドクラフト手法(NUS-PSL)を1.8%、提案ベースのCNN手法(HCP-1000C)を2.3%上回った。
  • 正解ボックスへの最近傍関係に基づくラベルビューは、良好に一般化され、学習に使用されなかったカテゴリの性能向上を促進しており、有効な局所的類似度学習が実現されていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。