Skip to main content
QUICK REVIEW

[論文レビュー] Towards an All-Purpose Content-Based Multimedia Information Retrieval System

Ralph Gasser, Luca Rossetto|edoc (University of Basel)|Feb 11, 2019
Advanced Image and Video Retrieval Techniques参考文献 76被引用数 4
ひとこと要約

本稿では、画像、音声、動画、3Dモデルの4つのメディアタイプを統合的に扱えるスケーラブルなスタックとしての、オープンソースで汎用的なコンテンツベースのマルチメディア検索システムである vitrivr を提示する。ADAM${}_{\textrm{pro}}$ を用いたメディア固有の特徴抽出と k-NN 検索の統合により、Query-by-Example や Query-by-Sketch といったクロスモーダル類似度検索が可能となり、ユーザー評価において最高 100% の成功率と、特定のタスクでは MRR 値が 1.0 に達する高い有効性を示した。

ABSTRACT

The growth of multimedia collections - in terms of size, heterogeneity, and variety of media types - necessitates systems that are able to conjointly deal with several forms of media, especially when it comes to searching for particular objects. However, existing retrieval systems are organized in silos and treat different media types separately. As a consequence, retrieval across media types is either not supported at all or subject to major limitations. In this paper, we present vitrivr, a content-based multimedia information retrieval stack. As opposed to the keyword search approach implemented by most media management systems, vitrivr makes direct use of the object's content to facilitate different types of similarity search, such as Query-by-Example or Query-by-Sketch, for and, most importantly, across different media types - namely, images, audio, videos, and 3D models. Furthermore, we introduce a new web-based user interface that enables easy-to-use, multimodal retrieval from and browsing in mixed media collections. The effectiveness of vitrivr is shown on the basis of a user study that involves different query and media types. To the best of our knowledge, the full vitrivr stack is unique in that it is the first multimedia retrieval system that seamlessly integrates support for four different types of media. As such, it paves the way towards an all-purpose, content-based multimedia information retrieval system.

研究の動機と目的

  • 大規模かつ多様なマルチメディアコレクションにおけるキーワードベース検索の限界を解消すること。
  • 現在のコンテンツベース検索システムが1つのメディアタイプに限定されているという閉じた構造を克服すること。
  • 4つのメディアタイプ(画像、音声、動画、3D モデル)を対象としたクロスモーダル類似度検索を可能にする統合的でスケーラブルなマルチメディア検索スタックの設計および実装。
  • 多様なクエリタイプとメディアモダリティを含む包括的なユーザー評価を通じて、システムの有効性を評価すること。
  • 今後の研究の基盤を提供するため、複数のモダリティにわたる新しい検索技術の検証が可能なオープンソースフレームワークを整備すること。

提案手法

  • 高次元ベクトル空間における効率的な k-Nearest Neighbours 検索を実現するため、ADAM${}_{\textrm{pro}}$ を統合する。
  • Cineast を拡張し、画像、音声、3D モデルの分野で14の新しい特徴モジュールを追加することで、コンテンツベースのインデクシングと検索を可能にする。
  • 4つのメディアタイプすべてで対応するクエリモード(Query-by-Example (QbE) および Query-by-Sketch (QbS) を含む)をサポートする。
  • メディア固有の特徴抽出技術を採用:画像には SIFT/VLAD、音声には クロマ/メロディ、3D モデルには 球面調和関数を用いる。
  • 混合メディアコレクションにおけるマルチモーダルでインタラクティブな検索とブラウジングを可能にする、ウェブベースのユーザーインターフェースを開発する。
  • 将来のモデルデプロイと実験を可能にするために、TensorFlow 互換レイヤーを介したディープラーニング統合を実装する。

実験結果

リサーチクエスチョン

  • RQ11つの統合システムが、画像、音声、動画、3D モデルという4つの異なるメディアタイプにわたるコンテンツベース検索を効果的にサポートできるか。
  • RQ2異種マルチメディアコレクションに応用されたクロスモーダル類似度検索(例:QbE や QbS)は、どの程度有効であるか。
  • RQ3異なるクエリモダリティ(例:スケッチ vs. 例示画像)が、検索の成功度とランク品質にどの程度影響を与えるか。
  • RQ4複数の特徴タイプ(例:色、形状、音声のクロマ、3D ジオメトリ)の統合が、検索パフォーマンスに与える影響はどの程度か。
  • RQ5実世界の評価環境において、多様なユーザーのタスクとメディアタイプにわたって、システムが高い使いやすさと有効性を維持できるか。

主な発見

  • 3D モデルの QbE タスクにおいて、100% の成功率と MRR 値 1.0 を達成し、関連する例が提供された場合に完全な検索パフォーマンスを示した。
  • 3D モデルのスケッチを用いた QbS タスクでは、成功率が 69% および 100%、MRR 値が 0.69 および 1.0 であり、スケッチベース検索において優れた性能を示した。
  • 音声検索における QbE では、成功率が 69%、MRR が 0.69 に達し、効果的なコンテンツベース音声検索を実現した。
  • 3D モデルの QbS タスクにおける p@15 値は 0.26 および 0.34 であり、わずかに関連性の高いアイテムも検索されたことが示され、NDCG@15 はユーザー評価と良好に一致した。
  • システムのパフォーマンスはオブジェクトクラスによって変動し、球面調和関数特徴量は一部の 3D モデルクラスでは低いパフォーマンスを示した(先行研究で報告済み)。
  • QbS タスクでは平均 2.8~4.5 回のクエリが必要であり、中程度のインタラクションコストであったが、QbE タスクはより高い成功率を示し、より効率的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。