Skip to main content
QUICK REVIEW

[論文レビュー] Crowd Counting with Density Adaption Networks

Li Wang, Weiyuan Shao|arXiv (Cornell University)|Jun 26, 2018
Video Surveillance and Tracking Methods参考文献 26被引用数 12
ひとこと要約

本稿では、集団の密度レベルを自動で推定し、低密度および高密度領域向けに事前に訓練された軽量カウンターネットワークの間で適応的に切り替えることで、集団カウントを実現する密度適応ネットワーク(DAN)を提案する。この手法は、ShanghaiTech Part BでCP-CNNより2.5 MAEの向上を達成し、単一GPUで20 FPSで動作する。

ABSTRACT

Crowd counting is one of the core tasks in various surveillance applications. A practical system involves estimating accurate head counts in dynamic scenarios under different lightning, camera perspective and occlusion states. Previous approaches estimate head counts despite that they can vary dramatically in different density settings; the crowd is often unevenly distributed and the results are therefore unsatisfactory. In this paper, we propose a lightweight deep learning framework that can automatically estimate the crowd density level and adaptively choose between different counter networks that are explicitly trained for different density domains. Experiments on two recent crowd counting datasets, UCF_CC_50 and ShanghaiTech, show that the proposed mechanism achieves promising improvements over state-of-the-art methods. Moreover, runtime speed is 20 FPS on a single GPU.

研究の動機と目的

  • 監視シナリオにおける異なる密度レベルでの一貫性のない集団カウント性能の課題に対処すること。
  • 極めて動的な状況や不均一に分布する集団条件下で失敗する、従来手法のユニバーサル正規化またはスケーリングの限界を克服すること。
  • 入力画像の密度に応じて最適なカウンターネットワークを動的に選択できる、軽量でエンド・ツー・エンドのディープラーニングフレームワークを構築すること。
  • 再トレーニングやアーキテクチャの複雑さを大幅に増やすことなく、データセット間での精度と一般化性能を向上させること。

提案手法

  • 低密度用(LCN)および高密度用(HCN)の複数のカウンターネットワークと統合された密度レベル推定器を備えた空間ゲーティングユニットを導入する。
  • 画像パッチの主な密度ドメインをグリッドベースの分類ヘッドを用いて予測するための密度レベル分類器(DAN)を訓練する。
  • 共有バックボーンネットワークで特徴を抽出し、その後に低密度領域および高密度領域用の別々のサブネットワーク(LCN および HCN)を適用する。
  • 適応的推論を実装:予測された密度クラスに応じて、各画像パッチを処理するカウンターネットワークを決定することで、ドメイン特化の適応を実現する。
  • 局所的詳細の保持と回帰精度の向上を目的に、離散的ヘッドカウントアノテーションと連続的密度マップの両方をトレーニングに活用する。
  • カウント回帰と密度分類の両方を組み合わせたマルチタスク損失を用いて、全体のパイプラインをエンド・ツー・エンドで最適化する。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングフレームワークは、集団画像の密度レベルを自動で検出し、最も適したカウンターネットワークに適応的に切り替えられるか?
  • RQ2ドメイン特化のカウンターネットワーク間での適応的選択は、ユニバーサル正規化や固定アーキテクチャと比較して、精度をどのように向上させるか?
  • RQ3提案手法は、異なる集団分布や撮影条件を持つデータセット間で、どの程度一般化可能か?
  • RQ4動的な集団カウントシナリオにおいて、モデルの複雑さ、推論速度、精度の間にはどのようなトレードオフが生じるか?

主な発見

  • ShanghaiTech Part Bでは、CP-CNNより2.5 MAEの向上を達成し、MAE 17.6、MSE 26.8を記録した。
  • UCF_CC_50では、Shangらの前例となる最先端手法よりMAEを35.8削減し、Part AでMAE 88.5、MSE 147.6を達成した。
  • 密度レベル推定器(DAN)は、画像パッチを低密度または高密度ドメインに分類する際、96%の正確性を達成した。
  • 単一のNVIDIA Titan X GPUで20 FPSで動作し、リアルタイム応用に適した高い効率性を示した。
  • トランスファーラーニングの実験では、ターゲットデータセットでの微調整により、微調整なしの状態と比較してMAEが5.6、MSEが6.4改善した。
  • 局所的詳細の保持と計算効率の両立を最適化するため、8×8グリッドサイズと512×512入力解像度が最適であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。