Skip to main content
QUICK REVIEW

[論文レビュー] From Selective Deep Convolutional Features to Compact Binary Representations for Image Retrieval

Thanh-Toan Do, Tuan Hoang|arXiv (Cornell University)|Feb 7, 2018
Advanced Image and Video Retrieval Techniques参考文献 81被引用数 7
ひとこと要約

本論文は、SIFTマスク、SUMマスク、MAXマスクを用いて冗長な深層畳み込み特徴を選択的に pruning することで、特徴の判別力を向上させる、計算的に効率的な画像検索フレームワークを提案する。その後に最先端の埋め込みとアグリゲーションを適用し、最後にハッシングを用いて表現をコンパクトなバイナリコードに圧縮する。本手法は6つのベンチマークで最先端の性能を達成し、実数値表現および非常にコンパクトなバイナリ表現の両面で、先行研究を顕著に上回る。

ABSTRACT

In the large-scale image retrieval task, the two most important requirements are the discriminability of image representations and the efficiency in computation and storage of representations. Regarding the former requirement, Convolutional Neural Network (CNN) is proven to be a very powerful tool to extract highly discriminative local descriptors for effective image search. Additionally, in order to further improve the discriminative power of the descriptors, recent works adopt fine-tuned strategies. In this paper, taking a different approach, we propose a novel, computationally efficient, and competitive framework. Specifically, we firstly propose various strategies to compute masks, namely SIFT-mask, SUM-mask, and MAX-mask, to select a representative subset of local convolutional features and eliminate redundant features. Our in-depth analyses demonstrate that proposed masking schemes are effective to address the burstiness drawback and improve retrieval accuracy. Secondly, we propose to employ recent embedding and aggregating methods which can significantly boost the feature discriminability. Regarding the computation and storage efficiency, we include a hashing module to produce very compact binary image representations. Extensive experiments on six image retrieval benchmarks demonstrate that our proposed framework achieves the state-of-the-art retrieval performances.

研究の動機と目的

  • 深層畳み込み特徴におけるバーストネス問題に寄与する、判別力の低下を是正すること。
  • 選択的特徴マスキングと高度な埋め込み・アグリゲーション技術を組み合わせることで、特徴の判別力を向上させること。
  • ハッシングを用いて表現をコンパクトなバイナリコードに生成することで、大規模な検索を効率的に行えるようにすること。
  • 実数値表現および非常にコンパクトなバイナリ画像表現の両方で最先端の性能を達成すること。
  • 特徴の pruning を通じて処理時間を短縮することで、計算効率の向上を実証すること。

提案手法

  • 代表的な局所的畳み込み特徴を選択し、冗長なものを除去するための3つのマスキング方式(SIFTマスク、SUMマスク、MAXマスク)を提案する。
  • SIFTマスクにはSIFT検出器の座標を、SUMマスクには特徴マップ全体の和プーリングを、MAXマスクには最大プーリングに加え位置情報の抽出を用いる。
  • 判別力の向上を図るため、最先端の埋め込みとアグリゲーション手法(例:Jégou & Zisserman, 2014;Do & Cheung, 2018)を適用する。
  • ITQベースのハッシングモジュールを統合し、実数値表現をコンパクトなバイナリコードに圧縮することで、効率的な保存と検索を実現する。
  • マスキング → 埋め込み/アグリゲーション → ハッシングの段階的フレームワークを採用し、検索性能を最適化するエンドツーエンドの最適化を実施する。
  • バックボーンネットワークにVGG-16を用い、特徴アグリゲーションの前段階でマスキングを適用することで、計算負荷を低減する。

実験結果

リサーチクエスチョン

  • RQ1選択的マスキングにより、バーストネスと冗長性を低減させることで、特徴の検索精度が向上するか?
  • RQ2選択的特徴マスキングと高度な埋め込み・アグリゲーション手法を組み合わせることで、標準的手法に比べてより優れた判別的表現が得られるか?
  • RQ3提案フレームワークは、実数値表現およびコンパクトなバイナリ画像表現の両方で最先端の性能を達成できるか?
  • RQ4R-MACなどの既存手法と比較して、提案フレームワークの計算効率はどの程度優れているか?
  • RQ5SIFTマスク、SUMマスク、MAXマスクといった異なるマスキング戦略が、性能と速度にどの程度寄与しているか?

主な発見

  • 提案フレームワークは、6つの画像検索ベンチマークで最先端の性能を達成し、Oxford5kでは512ビットバイナリコードで68.9%のmAP、Paris106kでは70.3%を達成した。
  • 64バイトの表現サイズにおいて、GeM(Radenović et al., 2017)をOxford5kで+11.2%、Holidaysで+22.6%上回った。
  • MAXマスクとSUMマスクは、それぞれ特徴の冗長性を約70%および50%低減させ、計算コストの顕著な削減を実現した。
  • 512-D表現においてR-MACよりも高速であり、効果的な特徴の pruning により、オンライン処理時間が短縮された。
  • MAXマスク、Δ埋め込み、ITQハッシングの組み合わせにより、64バイトバイナリコードでHolidaysで83.6%のmAPを達成し、先行SOTAを上回った。
  • 実験的アブレーションにより、すでに判別力が高い深層特徴に対しても、選択的特徴に対する埋め込みとアグリゲーションが性能を顕著に向上させることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。