Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Human Association between Top and Horizontal Views by Matching Subjects' Spatial Distributions

Ruize Han, Yujun Zhang|arXiv (Cornell University)|Jul 26, 2019
Video Surveillance and Tracking Methods参考文献 22被引用数 11
ひとこと要約

本論文は、ドローン(上空視点)とウェアラブルカメラ(水平視点)の画像間で、被写体の空間的分布を照合することで、新たな手法を提案する。幾何学的ベクトル表現と照合コスト関数を用い、上空視点におけるカメラの位置と視角を推定する。新しいデータセット上で、平均精度79.6%、平均再現率77.0%を達成し、ベースライン手法を上回る性能を示す。特に、被覆や変動する被写体の重複がある状況でも優れた性能を発揮する。

ABSTRACT

Video surveillance can be significantly enhanced by using both top-view data, e.g., those from drone-mounted cameras in the air, and horizontal-view data, e.g., those from wearable cameras on the ground. Collaborative analysis of different-view data can facilitate various kinds of applications, such as human tracking, person identification, and human activity recognition. However, for such collaborative analysis, the first step is to associate people, referred to as subjects in this paper, across these two views. This is a very challenging problem due to large human-appearance difference between top and horizontal views. In this paper, we present a new approach to address this problem by exploring and matching the subjects' spatial distributions between the two views. More specifically, on the top-view image, we model and match subjects' relative positions to the horizontal-view camera in both views and define a matching cost to decide the actual location of horizontal-view camera and its view angle in the top-view image. We collect a new dataset consisting of top-view and horizontal-view image pairs for performance evaluation and the experimental results show the effectiveness of the proposed method.

研究の動機と目的

  • 上空視点と水平視点の動画ストリーム間で、外見の違いが顕著な複数の被写体を関連付ける課題に対処すること。
  • カメラの視界方向に関する仮定や一貫した運動方向に依存する従来手法の限界を克服すること。
  • 外見や運動特徴ではなく、空間幾何に基づいて、耐障害性の高いクロスビュー被写体関連付け手法を開発すること。
  • 評価のための新しいデータセットを収集・公開し、上空視点と水平視点のペア画像と、真値の被写体関連付けを含むこと。
  • 被写体の一部しか両視点で共有されていない場合や、被覆が発生する場合でも、正確な被写体関連付けを可能にすること。

提案手法

  • 被写体のサイズと相対的位置に基づく2次元ベクトルを用いて、水平視点画像内の検出済み被写体の空間的分布をモデル化し、ベクトル集合 V^hor を形成する。
  • 上空視点画像における各検出済み被写体および仮定されるカメラの位置・方向について、視界に含まれる被写体の期待される空間的分布を推定する。
  • 候補となるカメラ位置と視角から、上空視点で視界に含まれる被写体の対応するベクトル集合 V^top を構築する。
  • V^hor と V^top 間の照合コスト関数を定義し、空間的分布の類似度を評価し、最良のカメラ位置と視角を最適化する。
  • 照合コストを最小化するように、上空視点画像内の可能なカメラ位置と視角を走査するためのグリーディ探索戦略を用いる。
  • ベクトル表現の構築時に被覆された被写体を特定・除外することで、簡単な被覆処理戦略を統合する。

実験結果

リサーチクエスチョン

  • RQ1外見の違いが顕著な上視点と水平視点間で、空間的分布照合がクロスビュー被写体関連付けを改善できるか?
  • RQ2関連付けられる被写体の数や両視点間の共有被写体の割合が変化する条件下で、本手法の性能はどのように変化するか?
  • RQ3被覆がクロスビュー被写体関連付けの性能に及ぼす影響はどの程度で、効果的に緩和可能か?
  • RQ4被写体の一部しか両視点に存在しない場合(例:視界外にある被写体)にも、本手法は一般化可能か?
  • RQ5外見ベースまたは運動ベースの再識別手法と比較して、本手法の耐障害性と正確性はどのように優れているか?

主な発見

  • 本手法は、全データセット上で平均精度79.6%、平均再現率77.0%を達成し、手動および自動ベースラインを上回る性能を示した。
  • 関連付けられる被写体の数が少なすぎたり多すぎたりする場合、性能が低下する傾向にあり、疎なシーンや混雑したシーンでの課題を示している。
  • 共有被写体の割合が高い画像ペアでは、本手法は強力な性能を維持しており、共有被写体の割合が高くなるほど、精度と再現率が向上する傾向を示した。
  • 被覆処理の導入により、性能が顕著に向上し、被覆サブセットにおける平均再現率が、被覆処理なしの65.1%から74.5%に上昇した。
  • 本手法は、多くの非共有被写体(例:いずれの視点でも視界外にある被写体)がある場合でも、部分的な重複に対しても耐障害性を示した。
  • 失敗事例の主な原因は、被写体検出の誤りや、被写体密度が高いために被覆が誤って分類されることであり、検出精度の限界が顕在化している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。