Skip to main content
QUICK REVIEW

[論文レビュー] Detection, Tracking, and Counting Meets Drones in Crowds: A Benchmark

Longyin Wen, Dawei Du|arXiv (Cornell University)|May 6, 2021
Video Surveillance and Tracking Methods参考文献 42被引用数 8
ひとこと要約

本稿では、112本の映像、33,600フレーム、480万件の頭部アノテーションを備えた大規模なドローン撮影動画ベンチマーク「DroneCrowd」と、密度の高い群衆における一括検出・追跡・数え上げを統合的に処理するためのモデルである、空間時間的隣接関係を考慮したネットワーク(STNNet)を紹介する。STNNetは、物体同士の時間的整合性を保つために隣接領域のコンテキスト損失を用いたマルチタスク学習を採用し、密度推定、局所化、追跡の各タスクで最先端の性能を達成した。

ABSTRACT

To promote the developments of object detection, tracking and counting algorithms in drone-captured videos, we construct a benchmark with a new drone-captured largescale dataset, named as DroneCrowd, formed by 112 video clips with 33,600 HD frames in various scenarios. Notably, we annotate 20,800 people trajectories with 4.8 million heads and several video-level attributes. Meanwhile, we design the Space-Time Neighbor-Aware Network (STNNet) as a strong baseline to solve object detection, tracking and counting jointly in dense crowds. STNNet is formed by the feature extraction module, followed by the density map estimation heads, and localization and association subnets. To exploit the context information of neighboring objects, we design the neighboring context loss to guide the association subnet training, which enforces consistent relative position of nearby objects in temporal domain. Extensive experiments on our DroneCrowd dataset demonstrate that STNNet performs favorably against the state-of-the-arts.

研究の動機と目的

  • ドローンを用いた群衆の数え上げ、検出、追跡の分野において、大規模かつ公開可能なベンチマークの不足に対処すること。
  • ドローン撮影動画における密度マップ推定、物体の局所化、複数物体追跡を統合的に処理する深層学習フレームワークの開発。
  • 近隣の物体同士の相対的位置関係が時間経過に伴って一貫性を持つように制約を課す、新しい隣接コンテキスト損失の設計。
  • 新規のDroneCrowdベンチマーク上で最先端の手法を上回る性能を示す強力なベースラインモデル(STNNet)の確立。

提案手法

  • STNNetは、2本のブランチを持つ畳み込みニューラルネットワーク(CNN)を用いてマルチスケール特徴を抽出するとともに、連続するフレーム間の時間的相関を計算する特徴抽出サブネットワークで構成される。
  • モデルには、群衆の数え上げのための密度マップ推定ヘッド、分類と回帰のブランチを備えた局所化サブネット、およびフレーム間の動きオフセットを予測する関連性サブネットが含まれる。
  • 隣接する物体の相対的位置関係が時間的に一貫しない場合にペナルティを与えるために、隣接コンテキスト損失が導入され、追跡の時間的整合性が向上する。
  • 隣接コンテキスト損失におけるサイクル戦略は、前向きおよび後向きの動きオフセットを両方考慮することで、軌道推定のロバスト性を向上させる。
  • 全ネットワークはマルチタスク損失とAdam最適化アルゴリズムを用いてエンド・ツー・エンドで学習され、その後、長時間の軌道生成のための最小コストフローまたはソーシャル-LSTMによる後処理が実施される。

実験結果

リサーチクエスチョン

  • RQ1提案されたSTNNetモデルは、ドローンで撮影された密な群衆における検出・追跡・数え上げを統合的に効果的に処理できるか?
  • RQ2近隣の物体同士の空間的・時間的整合性を強制する隣接コンテキスト損失は、局所化および追跡性能をどの程度向上させるか?
  • RQ3局所化サブネットおよび関連性サブネットを含めることで、密度マップのみのベースラインと比較して全体の性能にどのような影響を与えるか?
  • RQ4隣接コンテキスト損失におけるサイクル戦略や関係性制約を削除した場合、追跡および局所化の精度にどのような影響が生じるか?

主な発見

  • STNNetは、群衆局所化において40.45%のL-mAPを達成し、2番目に優れた手法(DM-Count)を22.28ポイント上回った。
  • 局所化サブネットを含まないベースラインと比較して、平均絶対誤差(MAE)が2.8減少、平均二乗誤差(MSE)が3.5減少した。これは、局所化サブネットが精度向上に果たす重要な役割を示している。
  • STNNetは、追跡タスクで32.50%のT-mAPを達成し、2番目に優れた手法(DM-Count)の15.49ポイント上回った。これは、優れた追跡性能を裏付けるものである。
  • 関連性サブネットを削除すると、T-mAPが0.88ポイント低下(40.45% → 31.44%)した。これは、軌道の整合性を維持する上で重要な役割を果たしていることを示している。
  • サイクル戦略を含む隣接コンテキスト損失は、関係性制約を欠いたバージョンと比較して、L-mAPが0.22%向上、T-mAPが0.24%向上した。これにより、その有効性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。