Skip to main content
QUICK REVIEW

[論文レビュー] Locality-constrained Spatial Transformer Network for Video Crowd Counting

Yanyan Fang, Biyun Zhan|arXiv (Cornell University)|Jul 18, 2019
Video Surveillance and Tracking Methods参考文献 23被引用数 7
ひとこと要約

本稿では、隣接フレーム間の空間的・時間的依存関係を局所制約付き空間変換器モジュールを用いて明示的にモデル化する、動画集団数のための局所制約付き空間変換ネットワーク(LSTN)を提案する。フレームをブロックに分割し、フレーム間のブロック類似度で歪み誤差を重み付けすることで、遮蔽や動きが生じる動的シーンにおける密度マップ推定を向上させ、複数のデータセットで最先端の性能を達成するとともに、13の異なるシーンを含む15,000フレーム、394,081個のアノテート済み頭部を有する、動画集団数分野で最大のデータセットFDSTを提供した。

ABSTRACT

Compared with single image based crowd counting, video provides the spatial-temporal information of the crowd that would help improve the robustness of crowd counting. But translation, rotation and scaling of people lead to the change of density map of heads between neighbouring frames. Meanwhile, people walking in/out or being occluded in dynamic scenes leads to the change of head counts. To alleviate these issues in video crowd counting, a Locality-constrained Spatial Transformer Network (LSTN) is proposed. Specifically, we first leverage a Convolutional Neural Networks to estimate the density map for each frame. Then to relate the density maps between neighbouring frames, a Locality-constrained Spatial Transformer (LST) module is introduced to estimate the density map of next frame with that of current frame. To facilitate the performance evaluation, a large-scale video crowd counting dataset is collected, which contains 15K frames with about 394K annotated heads captured from 13 different scenes. As far as we know, it is the largest video crowd counting dataset. Extensive experiments on our dataset and other crowd counting datasets validate the effectiveness of our LSTN for crowd counting.

研究の動機と目的

  • 動き、遮蔽、視点の変化による動画フレーム間での頭部密度推定の不一致という課題に対処すること。
  • RNNベースの方法に内在する履歴モデリングに依存するのではなく、隣接フレーム間の空間的・時間的整合性を明示的にモデル化することで、動画集団数のロバスト性を向上させること。
  • 従来のデータセットが小さく、フレーム単位のアノテーションが不足しているという限界を克服するため、13の多様なシーンを含む新しい大規模動画集団数データセットを収集すること。
  • 空間ブロックに変換推定を局所化することで、人々が入退場したり遮蔽されたりするような動的シーンの変化に適応できる手法を開発すること。
  • 類似度に配慮した局所化された密度マップのワープが、グローバル変換や暗黙の履歴モデリングに比べて、動画集団数の分野で優れていることを実証すること。

提案手法

  • 各動画フレームの初期密度マップを回帰するために畳み込みニューラルネットワーク(CNN)が用いられる。
  • 局所制約付き空間変換(LST)モジュールが、前のフレームの密度マップを変換して現在のフレームの密度マップを予測する。この変換はブロック単位の空間的変換を用いる。
  • 各フレームが重複のない空間ブロックに分割され、局所的なシーン変化に対するロバスト性を向上させる。
  • LSTモジュールは、連続するフレーム間の対応するブロック間の類似度を学習された類似度メトリックを用いて計算し、歪んだ密度マップと正例との差を重みづけする。
  • 損失関数は、ブロックごとの歪み誤差を重みづけたもので、空間的・時間的アライメントを可能にするエンドツーエンドの学習を可能にする。
  • 空間的・時間的整合性を強調する組み合わせ損失関数を用いて、エンドツーエンドで学習が行われる。特に、隣接フレーム間で類似度が高い領域での正確な密度予測を重視する。

実験結果

リサーチクエスチョン

  • RQ1隣接フレーム間の明示的かつブロック単位の空間的変換は、暗黙のRNNベースの方法と比較して、動画集団数の精度を向上させることができるか?
  • RQ2空間的ブロック間の局所的類似度を組み込むことで、遮蔽や人々の入退場が生じる状況下でも、密度マップ推定にどのような影響を与えるか?
  • RQ3局所制約付きアプローチは、グローバル空間的変換や標準的なConvLSTMに比べて、集団数の時間的ダイナミクスをモデル化する上で優れているか?
  • RQ4大規模かつフレーム単位のアノテーションが付与された動画集団数データセットは、モデルの評価および学習にどの程度の向上効果をもたらすか?
  • RQ5提案手法は、集団のダイナミクスやカメラの視点が異なる多様な実世界のシーンに一般化可能か?

主な発見

  • 提案されたLSTNモデルは、FDSTデータセットで平均絶対誤差(MAE)3.35を達成し、LSTを含まないベースライン(MAE: 3.81)およびConvLSTM(MAE: 4.48)といった最先端手法を上回った。
  • UCSDデータセットでは、LSTNはMAE 1.07、MSE 1.39を達成し、MCNN(MAE: 1.07、MSE: 1.35)およびConvLSTM(MAE: 1.30、MSE: 1.79)を上回った。
  • Mallデータセットでは、LSTNが最も低いMAE(2.00)とMSE(2.50)を記録し、双方向ConvLSTM(MAE: 2.10、MSE: 2.70)を上回った。
  • アブレーションスタディの結果、LSTモジュールにおける類似度項が、すべてのデータセットで一貫して性能向上をもたらし、FDSTでは類似度項を含めることで相対的にMAEが12.6%低減された。
  • 13のシーンを含み、15,000フレーム、394,081個のアノテート済み頭部を有するFDSTデータセットは、現在までで最大の動画集団数データセットであり、フレーム単位のアノテーションを備えることで、細粒度な評価が可能になった。
  • LSTNはFDSTデータセットにおいて、単一画像ベースラインよりも顕著に優れた性能を示し、動画集団数における明示的な時間的モデリングの価値を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。