Skip to main content
QUICK REVIEW

[論文レビュー] The WILDTRACK Multi-Camera Person Dataset

Tatjana Chavdarova, Pierre Baqué|arXiv (Cornell University)|Jul 28, 2017
Video Surveillance and Tracking Methods参考文献 24被引用数 10
ひとこと要約

WILDTRACKデータセットは、7台の同期化されたHDカメラ、正確なキャリブレーション、3Dバウンディングボックスのアノテーションを備えた大規模かつ高解像度のマルチカメラ人物検出ベンチマークを導入する。これにより、マルチビューでの歩行者検出およびキャリブレーションのための高度なディーブラーニング手法の開発が可能となり、スケール、精度、およびマルチビューおよび単眼検出研究における有用性の面で、先行するデータセットを凌駕する。

ABSTRACT

People detection methods are highly sensitive to the perpetual occlusions among the targets. As multi-camera set-ups become more frequently encountered, joint exploitation of the across views information would allow for improved detection performances. We provide a large-scale HD dataset named WILDTRACK which finally makes advanced deep learning methods applicable to this problem. The seven-static-camera set-up captures realistic and challenging scenarios of walking people. Notably, its camera calibration with jointly high-precision projection widens the range of algorithms which may make use of this dataset. In aim to help accelerate the research on automatic camera calibration, such annotations also accompany this dataset. Furthermore, the rich-in-appearance visual context of the pedestrian class makes this dataset attractive for monocular pedestrian detection as well, since: the HD cameras are placed relatively close to the people, and the size of the dataset further increases seven-fold. In summary, we overview existing multi-camera datasets and detection methods, enumerate details of our dataset, and we benchmark multi-camera state of the art detectors on this new dataset.

研究の動機と目的

  • 歩行者検出のための、大規模かつ高精度なマルチカメラデータセットの不足に対処すること。
  • ディープラーニングベースのマルチビュー検出およびカメラキャリブレーションアルゴリズムの開発とベンチマーク化を可能にすること。
  • 共同でキャリブレーションされたカメラと豊富な視覚的文脈を備えたデータセットを提供し、検出のロバスト性を向上させること。
  • 高解像度で密にアノテートされたデータを通じて、マルチビュー検出および単眼検出研究を支援すること。
  • キャリブレーションのための正確な真値アノテーションとキャリブレーションパターンを備えることで、自動カメラキャリブレーションの進展を促進すること。

提案手法

  • データセットは、実際の屋外環境に設置された、視野が重複する7台の静止型HDカメラを用いて収録された。
  • 3D真値測定値と可視のチェスボードパターンを用いてカメラキャリブレーションが実施され、バンドル調整のための3D-2D対応点が利用された。
  • 全ビューで同時に3Dバウンディングボックスラベル付けが可能な、独自開発のウェブベースのアノテーションツールが開発された。これにより、アノテーションの正確性と効率性が向上した。
  • アノテーターは、各カメラビューに投影された3Dシリンダーモデルを用い、同じ歩行者に最もよく一致するように位置を調整した。
  • アノテーションプロセスでは、訓練済みのアノテーターがAmazon Mechanical Turkを用い、前回のフレームのアノテーションを読み込んで修正することで、速度と一貫性を向上させた。
  • データセットには、3Dバウンディングボックス、2D投影、キャリブレーションパラメータ、外部および内部キャリブレーションのための真値3D点が含まれる。

実験結果

リサーチクエスチョン

  • RQ1大規模で高精度なマルチカメラデータセットは、マルチビュー歩行者検出モデルの性能にどのように寄与するか?
  • RQ2複数のビューにわたる共同3Dアノテーションは、遮蔽に対する検出精度とロバスト性をどの程度向上させるか?
  • RQ3WILDTRACKデータセットは、高度なカメラキャリブレーションアルゴリズムの開発とベンチマーク化を支援できるか?
  • RQ4高解像度で密な視覚的文脈が含まれることで、単眼歩行者検出の性能にどのような影響を与えるか?
  • RQ5複数の同期化カメラを介して3D歩行者位置をアノテートする際の実用的課題と制限とは何か?

主な発見

  • WILDTRACKデータセットには、7台のカメラで合計100,000個以上の3Dバウンディングボックスがアノテートされており、高解像度のHD動画と正確なキャリブレーションが実装されている。
  • Caltech歩行者データセットの7倍の規模であるため、ディープラーニングモデルの学習に適している。
  • 同期化されたチェスボードパターンと真値3D点の組み合わせにより、高精度なバンドル調整とキャリブレーション評価が可能になった。
  • 独自開発のアノテーションツールにより、前回のフレームのアノテーションを再利用したことで、ラベリング時間は50%削減され、訓練済みのアノテーターは高い正確性を達成した。
  • データセットはマルチビュー検出と単眼検出の両方をサポートしており、豊富な視覚的文脈がモデルの一般化性能を向上させた。
  • WILDTRACKを用いたベンチマークでは、ディープラーニングベースのマルチビュー検出器が、特に遮蔽下でも従来手法を著しく上回ることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。