Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Visual and Textual Information Fusion in Multimedia Retrieval - A Graph-based Point of View

Gabriela Csurka, Julien Ah-Pine|arXiv (Cornell University)|Jan 27, 2014
Advanced Image and Video Retrieval Techniques参考文献 61被引用数 6
ひとこと要約

本論文は、マルチメディア検索における視覚的・テキスト的情報の教師なし統合のための包括的なグラフベースのフレームワークを提案する。クロスメディア類似度とランダムウォークベースのスコアリング手法を統合し、一般化モデルの特殊ケースとして両手法を示す。3つの実世界データセットで検索性能を向上させるとともに、意味的フィルタリングによる計算複雑度の低減を実現する。

ABSTRACT

Multimedia collections are more than ever growing in size and diversity. Effective multimedia retrieval systems are thus critical to access these datasets from the end-user perspective and in a scalable way. We are interested in repositories of image/text multimedia objects and we study multimodal information fusion techniques in the context of content based multimedia information retrieval. We focus on graph based methods which have proven to provide state-of-the-art performances. We particularly examine two of such methods : cross-media similarities and random walk based scores. From a theoretical viewpoint, we propose a unifying graph based framework which encompasses the two aforementioned approaches. Our proposal allows us to highlight the core features one should consider when using a graph based technique for the combination of visual and textual information. We compare cross-media and random walk based results using three different real-world datasets. From a practical standpoint, our extended empirical analysis allow us to provide insights and guidelines about the use of graph based methods for multimodal information fusion in content based multimedia information retrieval.

研究の動機と目的

  • 教師なし信号を用いずに視覚的・テキスト的モダリティを統合することで、コンテンツベースのマルチメディア情報検索(CBMIR)における意味的ギャップを解消すること。
  • クロスメディア類似度とランダムウォークスコアリングの2つの代表的なグラフベースの統合手法を、一つの理論的フレームワークに統合すること。
  • テキストクエリの意味的フィルタリングを通じて、グラフベースのモデルにおける計算コストとストレージコストを削減すること。
  • 両統合手法の実世界のマルチメディアデータセットにおける性能を経験的に評価・比較すること。

提案手法

  • クロスメディア類似度とランダムウォークベースのスコアリングの両方を特殊ケースとして一般化する包括的なグラフベースのフレームワークを提案する。
  • 条件付き確率 p(v|u) を用いた意味的フィルタリングを適用し、テキスト類似度を精緻化することで関連性を向上させるとともに、複雑度を低減する。
  • 視覚特徴として、SIFTに類似する ORH と局所的色統計(LCS)を低レベル記述子として用い、Fisher Vector(FV)表現とガウス・ミックスチャネル(GMMs)を組み合わせる。
  • Fisherカーネルを用いて視覚的類似度を計算し、ドット積計算の効率化のためコレスキー分解を用いて正規化する。
  • ノードがマルチメディアアイテムを表し、エッジが視覚的およびテキスト的類似度を符号化するマルチモーダルグラフを構築する。
  • 空間ピラミッドプーリングを用い、画像領域(1×1、1×3、2×2)におけるFV表現を統合することで、視覚的特徴の空間的文脈を強化する。

実験結果

リサーチクエスチョン

  • RQ1マルチメディア検索において、視覚的およびテキスト的情報はどのように教師なしで効果的に統合できるか?
  • RQ2グラフベースの統合において、クロスメディア類似度とランダムウォークスコアリングの理論的関係は何か?
  • RQ3語義的含意に基づく意味的フィルタリングは、類似度推定の精度を向上させるとともに、計算負荷を低減できるか?
  • RQ4クロスメディア類似度とランダムウォークの2つのグラフベースの統合手法は、多様な実世界のマルチメディアデータセットでどのように性能を発揮するか?
  • RQ5スケーラブルで効果的なグラフベースのマルチモーダル統合モデルを構築するための主要な設計原則は何か?

主な発見

  • 提案された包括的フレームワークは、クロスメディア類似度とランダムウォークベースの手法が一般化されたグラフベースの統合モデルの特殊ケースであることを示した。
  • p(v|u) を用いた意味的フィルタリングは、テキスト類似度推定の精度を著しく向上させるとともに、グラフモデルの計算負荷を低減した。
  • 空間ピラミッドとGMMベースの視覚的ボキャブラリーを用いたFisherベクトルの使用は、強固な視覚的表現と高品質な類似度スコアを実現した。
  • 3つの実世界データセットにおいて、グラフベースの統合手法はベースライン手法を上回る性能を示し、特にランダムウォーク手法が検索精度で優れた結果を出した。
  • テキストの意味的フィルタリングと視覚的FV表現の統合により、2010年 Wikipedia データセットで26.3%のMAPを達成し、標準言語モデルを上回った。
  • 意味的フィルタリングによる関連接続数の削減により、性能を損なわず効率性を向上させるスケーラブルな検索が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。