Skip to main content
QUICK REVIEW

[論文レビュー] Object Level Deep Feature Pooling for Compact Image Representation

Konda Reddy Mopuri, R. Venkatesh Babu|NOT FOUND REPOSITORY (Indian Institute of Science Bangalore)|Apr 24, 2015
Advanced Image and Video Retrieval Techniques参考文献 34被引用数 12
ひとこと要約

本論文では、オブジェクト候補から得た深層特徴をプーリングすることで、グローバル画像特徴ではなくオブジェクトレベルの特徴を統合する、コン act な画像表現であるオブジェクトレベル深層特徴プーリング(OLDFP)を提案する。オブジェクトネスの事前知識を活用し、上位ランクの領域からの特徴を集約することで、メモリ使用量を著しく削減(バイナリ形式で1画像あたり2KBまで)しながら、平行移動、回転、スケーリングなどの幾何変換に対して頑健で、最先端の画像検索性能を達成する。

ABSTRACT

Convolutional Neural Network (CNN) features have been successfully employed in recent works as an image descriptor for various vision tasks. But the inability of the deep CNN features to exhibit invariance to geometric transformations and object compositions poses a great challenge for image search. In this work, we demonstrate the effectiveness of the objectness prior over the deep CNN features of image regions for obtaining an invariant image representation. The proposed approach represents the image as a vector of pooled CNN features describing the underlying objects. This representation provides robustness to spatial layout of the objects in the scene and achieves invariance to general geometric transformations, such as translation, rotation and scaling. The proposed approach also leads to a compact representation of the scene, making each image occupy a smaller memory footprint. Experiments show that the proposed representation achieves state of the art retrieval results on a set of challenging benchmark image datasets, while maintaining a compact representation.

研究の動機と目的

  • 平行移動、回転、スケーリングなどの幾何変換に対して標準的なCNN特徴が不変でないという問題を解決すること。
  • 大規模データベースにおけるスケーラブルなコンテンツベースの画像検索を実現するため、深層画像表現のメモリ容量を削減すること。
  • グローバルまたはローカルなパッチ特徴ではなく、意味的に意味のある画像領域に注目するオブジェクトネスの事前知識を活用することで、検索性能を向上させること。
  • 1画像あたり100〜500個の高スコアなオブジェクト候補のみを用いることで、計算コストを低減し、効率的な計算を可能にすること。
  • 小さな、データセット固有のデータで最小限のファインチューニングを行うことで、ネットワーク全体の再トレーニングなしに表現品質を向上させられることを示すこと。

提案手法

  • 選択的サーチを用いて入力画像からオブジェクト候補を抽出し、オブジェクトネススコアで順序付けして顕著な領域を優先する。
  • 事前学習済みのAlexNetの畳み込み層およびプーリング層を用いて、各オブジェクト候補から深層CNN特徴を抽出する。
  • 上位N個のオブジェクト候補からの深層特徴を平均プーリングにより集約し、固定長かつ順序に依存しない画像表現を形成する。
  • 反復的量子化(ITQ)を適用して、プールドされた特徴ベクトルを最小限の検索精度損失でバイナリコードに圧縮する。
  • ターゲットの検索データベースから小規模でクラスバランスの取れたデータセットを用いて、事前学習済みのAlexNetをファインチューニングする。これにより、特徴を特定のデータ分布に適応させる。
  • 最終的な全結合層(fc8)をターゲットデータセットのクラス数に調整し、初期層には低い学習率を適用して移譲可能な特徴を保持する。

実験結果

リサーチクエスチョン

  • RQ1オブジェクトレベルの深層特徴プーリングは、平行移動、回転、スケーリングなどの幾何変換に対して不変性を向上させることができるか?
  • RQ2グローバルまたはローカルなパッチ特徴ではなくオブジェクト候補を用いることで、よりコンパクトかつ判別力のある画像表現が得られるか?
  • RQ3検索性能を維持しつつ、表現をどの程度バイナリコードに圧縮できるか?
  • RQ41画像あたり何個のオブジェクト候補があれば、過剰な計算を伴わずに競争力のある検索精度を達成できるか?
  • RQ5ターゲットデータセットの小さなサブセットで最小限のファインチューニングを実施することで、検索性能を顕著に向上させられるか?

主な発見

  • 提案されたOLDFP表現は、Oxford5Kで3.84 mAP、Paris6Kで3.84 mAPを達成し、複数のベンチマークデータセットで最先端のmAPを達成した。
  • 1画像あたり100個のオブジェクト候補でさえも、計算効率とスケーラビリティを示す競争力あるmAPスコアを達成した。
  • ITQによるバイナリエンコードにより、メモリ使用量がわずか2KB/画像にまで削減されたが、フル精度表現と同等の検索性能を維持した。
  • 1クラスあたり10万枚のパッチから成る小規模でバランスの取れたデータセットでネットワークをファインチューニングすることで、すべてのデータセットで検索精度が向上し、Oxford5Kでは0.31 mAPの向上を達成した。
  • 特に128〜512次元のコンパクト表現領域において、VLAD、フィッシャー・ベクトル、Neural Codesといった既存手法を上回った。
  • オブジェクトレベル特徴の順序に依存しないプーリングにより、空間的配置の変化に対して頑健であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。