Skip to main content
QUICK REVIEW

[論文レビュー] Ego2Top: Matching Viewers in Egocentric and Top-view Videos

Shervin Ardeshir, Ali Borji|arXiv (Cornell University)|Jul 24, 2016
Video Analysis and Summarization参考文献 18被引用数 11
ひとこと要約

本稿では、視覚的コンテンツの変化と視点間の関係をモデル化することで、エゴセントリック動画録画とその対応するトップビュー監視映像内の人物を結びつけるスペクトルグラフマッチングフレームワーク、Ego2Topを提案する。単一特徴(GistとTop-FOV)とペairワイズ特徴(時間的視覚的関係)を組み合わせることで、グラフ構造と時間的ダイナミクスを活用して、エゴセントリック視点のユーザーをトップビュー動画内の身元に高精度にマッチングする。ベースラインを上回る性能を達成する。

ABSTRACT

Egocentric cameras are becoming increasingly popular and provide us with large amounts of videos, captured from the first person perspective. At the same time, surveillance cameras and drones offer an abundance of visual information, often captured from top-view. Although these two sources of information have been separately studied in the past, they have not been collectively studied and related. Having a set of egocentric cameras and a top-view camera capturing the same area, we propose a framework to identify the egocentric viewers in the top-view video. We utilize two types of features for our assignment procedure. Unary features encode what a viewer (seen from top-view or recording an egocentric video) visually experiences over time. Pairwise features encode the relationship between the visual content of a pair of viewers. Modeling each view (egocentric or top) by a graph, the assignment process is formulated as spectral graph matching. Evaluating our method over a dataset of 50 top-view and 188 egocentric videos taken in different scenarios demonstrates the efficiency of the proposed approach in assigning egocentric viewers to identities present in top-view camera. We also study the effect of different parameters such as the number of egocentric viewers and visual features.

研究の動機と目的

  • 監視および行動分析において相補的であるにもかかわらず、エゴセントリック視点とトップビュー視点の間の対応付けが不足している問題に対処すること。
  • 直接的な外見的手がかりが存在しない状況でも、どのエゴセントリックカメラ所有者がトップビューのカメラに映っている人物に対応するかを特定すること。
  • 異なるカメラ視点間で、視覚的コンテンツと時間的関係を用いて、視聴者の身元を推定する堅牢なフレームワークを開発すること。
  • エゴセントリックカメラの数が変化する条件下で、単一特徴とペairワイズ特徴の効果を評価すること。

提案手法

  • 各エゴセントリック動画およびトップビュー視点者を、その視覚的コンテンツを単一特徴(GistおよびTop-FOV記述子)で符号化したノードとしてグラフに表現する。
  • エゴセントリック動画コンテンツにおける時間的視覚的類似性を用いて、視点間のペアワイズ関係をモデル化し、グラフのエッジを形成する。
  • 単一特徴およびペアワイズ特徴に基づく類似度行列を計算することで、マッチング問題をスペクトルグラフマッチングとして定式化する。
  • スペクトルリラクゼーションを用いてエゴセントリックおよびトップビューのグラフ間のソフトマッチングを計算し、その後ハンガリアン法を用いてハードマッチングを実行する。
  • トラジェクトリーベースで視聴者の向きとTop-FOV(トップビュー視野)を推定し、エゴセントリック視点をトップビューのコンテンツと整合させる。
  • 複数対象追跡を適用してトップビューのトラジェクトリを抽出し、それらをTop-FOV推定および特徴計算の入力として使用する。

実験結果

リサーチクエスチョン

  • RQ1外見的手がかりに依存せずに、エゴセントリック動画コンテンツをトップビュー監視映像内の身元に効果的にマッチングできるか?
  • RQ2単一視覚的特徴(例:Gist、Top-FOV)と視点間のペアワイズ関係は、マッチング精度にどのように寄与するか?
  • RQ3利用可能なエゴセントリック動画の数が、視聴者マッチングのパフォーマンスに与える影響は何か?
  • RQ4単一特徴およびペアワイズ特徴を併用したスペクトルグラフマッチングは、単一特徴のみまたはランダムマッチングを用いるベースラインを上回るか?
  • RQ5エゴセントリック動画の完全性比(n_Ego / n_Top)が、マッチングおよびランク付け精度に与える影響は何か?

主な発見

  • スペクトルグラフマッチングにおいて単一特徴とペアワイズ特徴を併用した本手法は、ランダムマッチングや単一特徴のみの手法を著しく上回り、高いマッチング精度を達成する。
  • グラフマッチングスコアは、トップビュー動画および視聴者のランク付けに意味のある基準として機能する。図7(a)の赤線は、単一特徴のみの手法に比べて、累積マッチング精度の向上を示している。
  • ハードマッチング精度は、完全性比(n_Ego / n_Top)が高くなるに従い向上し、より多くのエゴセントリック動画がグラフ構造とマッチングの信頼性を高めることを示している。
  • ペアワイズ特徴は精度向上に顕著な寄与を示しており、図7(c)では、単一特徴のみのベースライン(HおよびG-F)に対して、GMの性能が一貫して向上している。
  • 本手法は、多様なシナリオにおいてエゴセントリック視聴者をトップビュー動画内で正しく特定でき、50本のトップビュー動画および188本のエゴセントリック動画を用いた評価により、堅牢性とスケーラビリティが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。