Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Driven Multi-Camera Pedestrian Detection

Alejandro López-Cifuentes, Marcos Escudero-Viñolo|arXiv (Cornell University)|Dec 27, 2018
Video Surveillance and Tracking Methods被引用数 7
ひとこと要約

本稿では、自動抽出されたセマンティックセグメンテーションを用いて共通の注目領域(AOI)を定義し、複数カメラ間で一括最適化を行う、シーンに依存しないセマンティック駆動型マルチカメラ歩行者検出手法を提案する。グローバル最適化とセマンティックヒントを活用することで、シナリオ固有のファインチューニングや手動によるAOIアノテーションを必要とせず、遮蔽や混雑状態の激しいシーンでも検出精度を向上させ、5つの公開データセットにおいて最先端手法を上回る性能を達成した。

ABSTRACT

In the current worldwide situation, pedestrian detection has reemerged as a pivotal tool for intelligent video-based systems aiming to solve tasks such as pedestrian tracking, social distancing monitoring or pedestrian mass counting. Pedestrian detection methods, even the top performing ones, are highly sensitive to occlusions among pedestrians, which dramatically degrades their performance in crowded scenarios. The generalization of multi-camera set-ups permits to better confront occlusions by combining information from different viewpoints. In this paper, we present a multi-camera approach to globally combine pedestrian detections leveraging automatically extracted scene context. Contrarily to the majority of the methods of the state-of-the-art, the proposed approach is scene-agnostic, not requiring a tailored adaptation to the target scenario extemdash e.g., via fine-tunning. This noteworthy attribute does not require extit{ad hoc} training with labelled data, expediting the deployment of the proposed method in real-world situations. Context information, obtained via semantic segmentation, is used 1) to automatically generate a common Area of Interest for the scene and all the cameras, avoiding the usual need of manually defining it; and 2) to obtain detections for each camera by solving a global optimization problem that maximizes coherence of detections both in each 2D image and in the 3D scene. This process yields tightly-fitted bounding boxes that circumvent occlusions or miss-detections. Experimental results on five publicly available datasets show that the proposed approach outperforms state-of-the-art multi-camera pedestrian detectors, even some specifically trained on the target scenario, signifying the versatility and robustness of the proposed method without requiring ad-hoc annotations nor human-guided configuration.

研究の動機と目的

  • マルチカメラ環境を用いた混雑で遮蔽が生じやすいシーンにおける歩行者検出の課題に対処すること。
  • マルチカメラ歩行者検出において、手動によるAOI定義やシナリオ固有のファインチューニングの必要性を排除すること。
  • セマンティックコンテキストとグローバル最適化を用いてカメラ間の検出を統合することで、検出のロバスト性と精度を向上させること。
  • ラベル付きトレーニングデータをシナリオごとに用意しなくてもよい、実世界の動画監視に適用可能な汎用的ソリューションの開発すること。

提案手法

  • セマンティックセグメンテーションを用いてシーンのコンテキストを抽出し、床面にわたる役割アノテーション付きの共通の注目領域(AOI)を自動的に定義する。
  • 最先端の検出器(例:EfficientDet)から得られる各カメラごとの検出結果を、ホモグラフィー変換を用いて共通の基準平面に投影する。
  • グラフベースの連結成分アプローチを用いてカメラ間の検出を統合し、空間的一致性を確保するとともに、AOI外の誤検出をフィルタリングする。
  • セマンティック駆動型のバックプロジェクション手法により、複数視点の情報を集約してボクセルボックスを精緻化し、局所化精度を向上させ、遮蔽に起因する誤差を低減する。
  • グローバル最適化フレームワークを用いて、2次元画像空間および3次元シーン空間の両方で検出の一貫性を最大化し、密着性の高い一貫性のある検出を生成する。
  • 一般的なセマンティックヒントに依存することで、シナリオごとのファインチューニングを回避し、新規環境への迅速な展開を可能にする。

実験結果

リサーチクエスチョン

  • RQ1シナリオ固有のファインチューニングや手動によるAOIアノテーションを必要としないマルチカメラ歩行者検出システムは、高い性能を達成できるか?
  • RQ2セマンティックセグメンテーションは、遮蔽や混雑状態の激しいシーンにおけるマルチカメラ歩行者検出の精度とロバスト性をどのように向上させるか?
  • RQ3シーンに依存しない手法は、ターゲットデータセットに特化して訓練された最先端手法をどの程度上回るか?
  • RQ4手動アノテーションによるAOIと比較して、自動生成されたAOIは検出性能と一般化能力においてどのように差が現れるか?
  • RQ5セマンティックヒントを用いたグローバル最適化は、自己遮蔽やキャリブレーション誤差によって生じる検出の不一致を効果的に解消できるか?

主な発見

  • 提案手法は、PETSやWildtrackを含む5つの公開データセットにおいて、ファインチューニングを行わないすべての最先端マルチカメラ歩行者検出手法を上回った。
  • Wildtrackデータセットにおいて、著者らが手動でアノテートしたAOIを評価基準とした場合、トップパフォーマンスを示す手法(Top-DeepMCD)を8.33%、DenseNet-DeepMCDを3.17%上回った。
  • トップパフォーマンス手法と同一のAOIを評価基準とした場合、本手法は、Re-ID特徴を追加した先行手法GMC-3Dに対して17.85%の性能向上を達成した。
  • PETSデータセットでは、トレーニングデータとして使用されていないにもかかわらず、Pre-DeepMCDに対して45.45%の性能向上を達成した。
  • 自動生成されたAOIを用いることで、手動アノテーションのAOIよりも床面のカバー範囲が広がったが、正例データの限界により若干の性能低下が生じた。これは、AOI定義に対する本手法のロバスト性を示している。
  • セマンティックヒントを活用することで、遮蔽や視点間の検出不一致を解消し、混雑状態の激しいシーンでも高い精度と密着性の高いボックスフィッティングを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。