Skip to main content
QUICK REVIEW

[論文レビュー] VRFP: On-the-fly Video Retrieval using Web Images and Fast Fisher Vector Products

Xintong Han, Bharat Singh|arXiv (Cornell University)|Dec 10, 2015
Advanced Image and Video Retrieval Techniques参考文献 64被引用数 5
ひとこと要約

VRFP は、短いテキストクエリを用いて取得したウェブ画像を活用して動画コンテンツのフィッシャー・ベクトル表現を構築し、リアルタイムの類似度照合を可能にする、オンザフライ型の動画検索フレームワークである。ロバストなフィッシャー・ベクトル特徴量と、スパarsityに配慮した損失なし内積高速化アルゴリズムを組み合わせることで、TRECVID MED13(16.4%)、MED14(9.67%)、CCV(40.8%)のデータセットで最先端の性能を達成した。

ABSTRACT

VRFP is a real-time video retrieval framework based on short text input queries, which obtains weakly labeled training images from the web after the query is known. The retrieved web images representing the query and each database video are treated as unordered collections of images, and each collection is represented using a single Fisher Vector built on CNN features. Our experiments show that a Fisher Vector is robust to noise present in web images and compares favorably in terms of accuracy to other standard representations. While a Fisher Vector can be constructed efficiently for a new query, matching against the test set is slow due to its high dimensionality. To perform matching in real-time, we present a lossless algorithm that accelerates the inner product computation between high dimensional Fisher Vectors. We prove that the expected number of multiplications required decreases quadratically with the sparsity of Fisher Vectors. We are not only able to construct and apply query models in real-time, but with the help of a simple re-ranking scheme, we also outperform state-of-the-art automatic retrieval methods by a significant margin on TRECVID MED13 (3.5%), MED14 (1.3%) and CCV datasets (5.2%). We also provide a direct comparison on standard datasets between two different paradigms for automatic video retrieval - zero-shot learning and on-the-fly retrieval.

研究の動機と目的

  • 事前に定義された概念バンクを一切使用せず、短いテキストクエリのみを用いてリアルタイムの動画検索を可能にすること。
  • 動画検索におけるノイズの多いウェブソース画像の課題に対処するため、ロバストな表現としてフィッシャー・ベクトルを用いること。
  • 高次元フィッシャー・ベクトル照合を高速化し、リアルタイム性能を実現すること。
  • テキストベースの動画検索の文脈において、オンザフライ検索とゼロショット学習を比較すること。
  • フィッシャー・ベクトルが他の表現形式に比べ、精度とノイズ耐性の両面で優れていることを実証すること。

提案手法

  • 検索エンジンを用いて、与えられたテキストクエリに対してウェブ画像を取得し、弱教師付き学習セットを構築する。
  • 畳み込みニューラルネットワーク(CNN)特徴量を用いて、クエリ用ウェブ画像と動画フレームの両方をフィッシャー・ベクトルとして表現する。各画像を順序なし画像集合として扱う。
  • スパarsityに配慮した損失なしアルゴリズムを用いて、高次元フィッシャー・ベクトル間の内積を計算し、スパarsityに応じて乗算回数を二次的に削減する。
  • 判別的学習を一切行わず、単純な再ランク付け戦略を適用することで、検索精度を向上させる。
  • フィッシャー・ベクトルのスパarsityを活用して計算を高速化し、リアルタイム推論を実現する。
  • YouTubeのサムネイルを用いて手法を拡張し、TRECVID データセットにおけるmAPをさらに向上させる。

実験結果

リサーチクエスチョン

  • RQ1ノイズの多いウェブソース画像および動画フレームを、フィッシャー・ベクトルで効果的に表現できるか?
  • RQ2ウェブ画像を用いたオンザフライ検索とゼロショット学習の間で、精度と効率の面でどのように比較できるか?
  • RQ3高次元フィッシャー・ベクトル間の内積計算は、精度を損なわずに高速化可能か?
  • RQ4提案手法は、標準ベンチマークにおいて最先端の自動動画検索システムを上回る性能を発揮するか?
  • RQ5表現のロバスト性とスパarsityは、検索性能にどのように影響を与えるか?

主な発見

  • VRFP は TRECVID MED13 で 16.4% の mAP を達成し、先行する自動手法よりも 3.5 パcentage points 以上優れた性能を示した。
  • TRECVID MED14 では 9.67% の mAP を達成し、次に優れた手法よりも 1.3 パcentage points の向上を達成した。
  • CCV データセットでは 40.8% の mAP を達成し、前回の最先端手法よりも 5.2 パcentage points の向上を達成した。
  • 損失なし高速化アルゴリズムにより、フィッシャー・ベクトルのスパarsityに応じて期待される乗算回数を二次的に削減でき、リアルタイム照合を可能にした。
  • 再ランク付け戦略により、すべてのデータセットで検索性能が向上し、初期ランク付けと後処理の有効性が確認された。
  • YouTube サムネイルの活用により、MED13 と MED14 でそれぞれ 0.39 および 0.32 ポints の mAP 向上が達成され、多様な視覚的データの価値が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。