Skip to main content
QUICK REVIEW

[論文レビュー] Indexing of CNN Features for Large Scale Image Search

Ruoyu Liu, Yao Zhao|arXiv (Cornell University)|Aug 2, 2015
Advanced Image and Video Retrieval Techniques参考文献 77被引用数 13
ひとこと要約

本論文は、CNN特徴量を用いた大規模な画像検索を高速化するための、逆引きテーブルベースのインデキシングフレームワーク、IFCを提案する。複数の語彙語の割り当てとハッシングによる埋め込みコードを活用することで、精度の損失を最小限に抑えながら、検索時間を最大17倍高速化し、複数のベンチマークでブルートフォース法や既存のハッシング手法を上回る性能を発揮する。

ABSTRACT

The convolutional neural network (CNN) features can give a good description of image content, which usually represent images with unique global vectors. Although they are compact compared to local descriptors, they still cannot efficiently deal with large-scale image retrieval due to the cost of the linear incremental computation and storage. To address this issue, we build a simple but effective indexing framework based on inverted table, which significantly decreases both the search time and memory usage. In addition, several strategies are fully investigated under an indexing framework to adapt it to CNN features and compensate for quantization errors. First, we use multiple assignment for the query and database images to increase the probability of relevant images' co-existing in the same Voronoi cells obtained via the clustering algorithm. Then, we introduce embedding codes to further improve precision by removing false matches during a search. We demonstrate that by using hashing schemes to calculate the embedding codes and by changing the ranking rule, indexing framework speeds can be greatly improved. Extensive experiments conducted on several unsupervised and supervised benchmarks support these results and the superiority of the proposed indexing framework. We also provide a fair comparison between the popular CNN features.

研究の動機と目的

  • 大規模な画像検索におけるグローバルCNN特徴量のインデキシングにかかる計算コストとストレージコストを低減すること。
  • 元々局所特徴量(例:SIFT)向けに設計された逆引きテーブル構造を、コンactなグローバルCNN特徴ベクトルを効率的にインデキシングできるように適応すること。
  • 複数の割り当てと埋め込みコードを用いることで、CNNベースの検索における量子化誤差と誤検出を低減すること。
  • ハッシング方式をインデキシングフレームワークに統合することで、高い精度を維持しながら検索速度を向上させること。
  • 統一的でスケーラブルなインデキシングフレームワークの下で、代表的なCNN特徴量の性能を公平に比較すること。

提案手法

  • 各CNN特徴ベクトルがクラスタリングを用いて複数の語彙語にマッピングされる逆引きテーブル構造を採用し、関連する画像が同じボロノイ細胞に共起する確率を高める。
  • 特徴ベクトルを複数の語彙語に割り当てることで、検索時の再現率を向上させ、量子化誤差を低減する。
  • ハッシング方式(例:VDSH)を用いて埋め込みコードを計算し、検索時に誤検出をフィルタリングしてマッチングを精緻化する。
  • ランク付けルールを変更し、語彙語類似度と埋め込みコード類似度の組み合わせに基づいて候補を優先順位付けすることで、精度を向上させる。
  • 教師ありおよび教師なしのハッシング手法をサポートし、統合の事例としてVDSHを用いる。
  • バイナリ埋め込みコード上の高速なビット単位の演算に置き換えることで、全ベクトル比較を回避し、検索効率を向上させる。

実験結果

リサーチクエスチョン

  • RQ1グローバルCNN特徴量の検索を高速化するために、逆引きテーブルインデキシング構造を効果的に適応できるか?
  • RQ2複数の語彙語への割り当ては、CNNベースのインデキシングにおける検索精度の向上と量子化誤差の低減にどのように寄与するか?
  • RQ3ハッシングに基づく埋め込みコードは、CNN特徴量検索において、速度を維持したままどれほど精度を向上させられるか?
  • RQ4大規模ベンチマークにおいて、提案されたIFCフレームワークはブルートフォース法や既存のハッシング手法と比較して、速度と精度の両面で優れているか?
  • RQ5インデキシングフレームワークの性能は、特徴抽出に用いられる基盤となるCNNアーキテクチャに依存するか?

主な発見

  • NUS-WIDE+Flickr1Mデータセットにおいて、IFCはVDSHと比較して最大17倍の高速化を達成し、mAPは5%の低下にとどまる。
  • オックスフォードおよびパリのデータセットでは、IFC-VDSHは高い精度を維持しており、それぞれmAPスコアが0.5865および0.5915に達する一方、1回のクエリあたりの検索時間を0.1秒未塔に短縮した。
  • 複数の語彙語への割り当てにより、関連する画像が同じボロノイ細胞に共起する確率が上昇し、再現率が顕著に向上した。
  • VDSHによる埋め込みコードの活用により、誤検出が低減され、特に高次元のCNN特徴空間において精度が向上した。
  • フレームワークは高い適応性を示し、AlexNet、VGG16、VGG19、GoogLeNet、ResNetsを含む複数のCNNアーキテクチャにおいて一貫した性能向上を示した。
  • メモリ使用量が顕著に削減され、フレームワークは画像IDとコンパクトなバイナリ埋め込みコードのみを格納するため、大規模な展開に適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。