Skip to main content
QUICK REVIEW

[論文レビュー] Embedding based on function approximation for large scale image search

Thanh-Toan Do, Ngai‐Man Cheung|arXiv (Cornell University)|May 23, 2016
Advanced Image and Video Retrieval Techniques参考文献 43被引用数 6
ひとこと要約

本稿では、関数近似を用いて高次元空間における非線形関数を近似することで、VLAD や TLCC を一般化する新しい埋め込み手法 FAemb を提案する。画像検索ベンチマークにおいて最先端の性能を達成しており、SIFT 特徴量を用いて Holidays で mAP 86.8、Oxford5k で 70.3 を達成した。また、大規模応用向けに高速な閉形式バージョンを導入している。

ABSTRACT

The objective of this paper is to design an embedding method that maps local features describing an image (e.g. SIFT) to a higher dimensional representation useful for the image retrieval problem. First, motivated by the relationship between the linear approximation of a nonlinear function in high dimensional space and the stateof-the-art feature representation used in image retrieval, i.e., VLAD, we propose a new approach for the approximation. The embedded vectors resulted by the function approximation process are then aggregated to form a single representation for image retrieval. Second, in order to make the proposed embedding method applicable to large scale problem, we further derive its fast version in which the embedded vectors can be efficiently computed, i.e., in the closed-form. We compare the proposed embedding methods with the state of the art in the context of image search under various settings: when the images are represented by medium length vectors, short vectors, or binary vectors. The experimental results show that the proposed embedding methods outperform existing the state of the art on the standard public image retrieval benchmarks.

研究の動機と目的

  • 高次元空間における関数近似を活用することで、VLAD や TLCC といった既存手法を一般化する統一された埋め込みフレームワークの構築を目的とする。
  • 大規模画像検索における計算ボトル neck を軽減するため、埋め込み手法の閉形式で高速なバージョンを導出することを目的とする。
  • SIFT や CNN といった局所特徴を用いて、より強力で判別力の高い表現を学習することで、画像検索性能の向上を目的とする。
  • 関数近似を通じて VLAD と TLCC の間の理論的つながりを確立し、VLAD が TLCC の簡略化されたバージョンであることを示すこと。
  • 単一ベクトル表現によってストレージと距離計算のオーバーヘッドを最小限に抑えることで、効率的な大規模検索を可能とすること。

提案手法

  • 高次元空間における基底関数の線形結合を用いて非線形関数 $ f({\mathbf{x}}) $ を近似することで、VLAD や TLCC の一般化として FAemb を提案する。
  • アングルポイント $ {\mathbf{v}}_j $ を用いた座標符号化 $ \gamma({\mathbf{x}}) $ を用い、局所記述子を高次元ベクトルにマッピングし、$ \sum_j \gamma_{{\mathbf{v}}_j}({\mathbf{x}}) = 1 $ を満たすようにする。
  • テイラー展開に基づく近似を採用:$ f({\mathbf{x}}) \approx \sum_{j} \gamma_{{\mathbf{v}}_j}({\mathbf{x}}) \sum_{|\alpha| \leq k} \frac{\partial^\alpha f({\mathbf{v}}_j)}{\alpha!} ({\mathbf{x}} - {\mathbf{v}}_j)^\alpha $、誤差は $ \frac{M}{(k+1)!} \sum_j |\gamma_{{\mathbf{v}}_j}({\mathbf{x}})| \|{\mathbf{x}} - {\mathbf{v}}_j\|_1^{k+1} $ で有界。
  • 事前に基底関数と重みを計算することで、埋め込みを閉形式で計算できる高速版 F-FAemb を導出。これにより、大規模な展開が可能になる。
  • SIFT や CNN といった局所特徴に埋め込みを適用し、標準的なプーリングや平均化を用いて単一ベクトルに集約する。
  • 標準的な画像検索ベンチマーク(Holidays、Oxford5k)を用い、フルクエリとクロップドクエリの両方で、さまざまなベクトル長での性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1高次元空間における関数近似を用いて、VLAD や TLCC を一般化する統一されたフレームワークを開発できるか?
  • RQ2提案手法 FAemb は、さまざまなベクトル長において、最先端の埋め込み手法と比較して検索精度に優れているか?
  • RQ3大規模画像検索を効率的に行うために、閉形式で高速な埋め込みのバージョンを導出できるか?
  • RQ4SIFT や CNN 特徴量を用いた標準ベンチマークにおいて、提案手法は既存手法を上回っているか?
  • RQ5代表長さ(例:256、1024、7245次元)が、提案手法の検索性能に与える影響は何か?

主な発見

  • SIFT 特徴量を用いて、Holidays データセットで mAP 86.8、Oxford5k(クロップドクエリ)で 70.3 を達成し、最先端手法を上回った。
  • Oxford5k データセットにおいて、F-FAemb は D=7,245 時に mAP 66.1 を達成し、CKN を上回り、CNN を用いた手法に近い性能を示したが、1 枚あたりの単一表現で達成された。
  • 高速版 F-FAemb は、埋め込みの閉形式計算を可能にし、R-MAC のようなパッチベース手法と比較してストレージと距離計算コストを削減した。
  • 短い表現(例:D=256)を用いた場合、F-FAemb は Holidays で mAP 74.0、Oxford5k で 45.6 を達成し、次元削減に対しても頑健であることが示された。
  • Holidays データセット(一般画像)では、F-FAemb を用いた場合、CNN 特徴量が SIFT よりも優れた結果を示したが、Oxford5k(特定の物体、例:建物)では SIFT が優れた性能を示した。
  • 理論的分析により、VLAD が TLCC の簡略化されたバージョンであることが確認され、FAemb は関数近似を通じて両者の根本的原理を統一することで、それらを一般化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。