Skip to main content
QUICK REVIEW

[論文レビュー] Motion-guided Non-local Spatial-Temporal Network for Video Crowd Counting

Haoyue Bai, S.-H. Gary Chan|arXiv (Cornell University)|Apr 28, 2021
Video Surveillance and Tracking Methods参考文献 32被引用数 4
ひとこと要約

本稿では、動的流れを用いて人物領域の粗いセグメンテーションをガイドするMotion-guided non-local spatial-temporal network、Monetを提案する。この手法は、空間的・時間的文脈を短距離および長距離の両方で捉えるためにnon-localネットワークを採用する。Monetは、VidCrowd、Mall、UCSDの各データセットで最先端の性能を達成し、UCSDでは1.54 MAE、挑戦的なVidCrowdデータセットでは1.17 MAEを記録する。また、9,000枚の高解像度フレームと115万件の頭部アノテーションを含む、新しい大規模な動画群衆計数データセットVidCrowdを提供する。

ABSTRACT

We study video crowd counting, which is to estimate the number of objects (people in this paper) in all the frames of a video sequence. Previous work on crowd counting is mostly on still images. There has been little work on how to properly extract and take advantage of the spatial-temporal correlation between neighboring frames in both short and long ranges to achieve high estimation accuracy for a video sequence. In this work, we propose Monet, a novel and highly accurate motion-guided non-local spatial-temporal network for video crowd counting. Monet first takes people flow (motion information) as guidance to coarsely segment the regions of pixels where a person may be. Given these regions, Monet then uses a non-local spatial-temporal network to extract spatial-temporally both short and long-range contextual information. The whole network is finally trained end-to-end with a fused loss to generate a high-quality density map. Noting the scarcity and low quality (in terms of resolution and scene diversity) of the publicly available video crowd datasets, we have collected and built a large-scale video crowd counting datasets, VidCrowd, to contribute to the community. VidCrowd contains 9,000 frames of high resolution (2560 x 1440), with 1,150,239 head annotations captured in different scenes, crowd density and lighting in two cities. We have conducted extensive experiments on the challenging VideoCrowd and two public video crowd counting datasets: UCSD and Mall. Our approach achieves substantially better performance in terms of MAE and MSE as compared with other state-of-the-art approaches.

研究の動機と目的

  • 動画群衆計数における空間的・時間的相関、特にフレーム間の長距離依存関係の有効なモデル化の欠如に対処すること。
  • 人物領域の局所化に運動情報(光学的フロー)を空間的事前分布として統合することで、推定精度を向上させること。
  • 密度マップ回帰のための局所的および非局所的空間的・時間的文脈を同時に捉える深層学習フレームワークの開発。
  • 既存の動画群衆計数データセットの不足と低品質を解消するため、新規の大規模かつ高解像度のデータセットVidCrowdの作成と公開。
  • 多様なシーン、照明、群衆密度を備えた動画群衆計数の新しいベンチマークの確立。

提案手法

  • 本手法は、光学的フローを用いて運動推定を実行し、運動ベクトルを生成することで、人物が含まれる可能性の高い領域に動画フレームをセグメンテーションする。これにより、空間的事前分布が得られる。
  • 運動ベースのセグメンテーションでガイドされた非局所空間的・時間的ネットワークを連続フレームに適用し、空間的・時間的両方で局所的(短距離)および非局所的(長距離)な文脈特徴を抽出する。
  • 段階的な精錬モジュールを用いて予測密度マップを段階的に精錬し、運動ガイドと非局所的文脈を統合する。
  • 複数の監視信号を統合した融合損失関数を用いて、ネットワーク全体をエンドツーエンドで学習させ、密度マップの品質と計数精度を向上させる。
  • 本フレームワークは、20の多様なシーンにまたがり、1,150,239件の頭部アノテーションを含む9,000枚の高解像度(2560×1440)フレームを含む新規に収集されたVidCrowdデータセット上で学習および評価される。

実験結果

リサーチクエスチョン

  • RQ1光学的フローとしての運動情報は、動画フレーム内での人物領域の局所化を向上させるために、どのように効果的に活用できるか?
  • RQ2非局所空間的・時間的ネットワークは、動画シーケンスにおける長距離依存関係をどの程度効果的に捉えることができるか?
  • RQ3運動ガイドと非局所モデリングを統合した統一された深層学習フレームワークは、困難なベンチマークで既存の動画ベース群衆計数手法を上回ることができるか?
  • RQ4提案されたMonetモデルは、多様な実世界の条件を備えた新規の大規模かつ高解像度の動画群衆計数データセットで、どのように性能を発揮するか?

主な発見

  • UCSDデータセットでは、Monetは1.54 MAEおよび2.02 MSEを達成し、すべての先行動画ベース手法を上回り、このベンチマークで最先端の性能を達成している。
  • 新たに導入されたVidCrowdデータセットでは、Monetは1.17 MAEおよび1.45 MSEを記録し、MCNN、CSRNet、SACANet、ConvLSTMを含むすべての比較手法を顕著に上回っている。
  • アブレーションスタディの結果、運動ガイドと非局所空間的・時間的モジュールの両方が不可欠であることが確認された。両者のいずれかを除去すると性能が著しく低下し、それらの相補的役割が裏付けられた。
  • Mallデータセットでも、Monetは2.10 MAEおよび7.60 MSEを達成し、すべての既存の動画ベース計数モデルを上回り、最先端の結果を達成した。
  • 9,000枚の高解像度フレームと1,150,239件の頭部アノテーションを含む新規のVidCrowdデータセットは、シーン、照明、群衆密度の多様性を備えており、既存のデータセットよりも多様性と挑戦性に富んだベンチマークを提供している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。