Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Scenario Discovery for Crowd Counting

Xingjiao Wu, Yingbin Zheng|arXiv (Cornell University)|Dec 6, 2018
Video Surveillance and Tracking Methods参考文献 21被引用数 5
ひとこと要約

本稿では、異なる受容 field を持つ2つの並列畳み込みパスウェイを用いて多スケールの混雑度を捉え、学習可能で離散化された適応ブランチにより応答を動的に補正する、適応的シナリオ発見(ASD)フレームワークを提案する。この手法は、ShanghaiTech および UCF_CC_50 で最先端の性能を達成し、先行する SOTA モデルと比較してそれぞれ MAE を 2.6% および 26.3% 減少させた。

ABSTRACT

Crowd counting, i.e., estimation number of the pedestrian in crowd images, is emerging as an important research problem with the public security applications. A key component for the crowd counting systems is the construction of counting models which are robust to various scenarios under facts such as camera perspective and physical barriers. In this paper, we present an adaptive scenario discovery framework for crowd counting. The system is structured with two parallel pathways that are trained with different sizes of the receptive field to represent different scales and crowd densities. After ensuring that these components are present in the proper geometric configuration, a third branch is designed to adaptively recalibrate the pathway-wise responses by discovering and modeling the dynamic scenarios implicitly. Our system is able to represent highly variable crowd images and achieves state-of-the-art results in two challenging benchmarks.

研究の動機と目的

  • 異なるカメラ画角、背景のごみ、混雑度の変動といった、密な混雑度計数における極めて多様なシナリオをモデル化する課題に対処すること。
  • 複数のブランチを備えた混雑度計数ネットワークにおける固定重み統合や手動によるシナリオ選択の限界を克服すること。
  • 入力画像の特徴に基づいてパスウェイの応答を動的に補正する学習可能で離散化された適応ブランチを用いて、暗黙的シナリオ発見を可能にすること。
  • 多様な実世界の混雑度画像において、歩行者数の予測の堅牢性と正確性を向上させること。
  • 明示的なシナリオアノテーションを必要とせず、ベンチマークデータセットで最先端の性能を達成すること。

提案手法

  • VGG をベースにした二パスウェイ畳み込みニューラルネットワークを設計し、1つのパスウェイはスパarsな群衆に適した広い受容 field を持ち、もう1つは密集した群衆に適した狭い受容 field を持つ。
  • 2つのパスウェイ出力に重みを動的に割り当てるために、微分可能で離散化されたソフトアテンション機構を用いた第3の適応ブランチを導入する。
  • グローバル平均プーリングと全結合層を適用して、シナリオに適応した統合重みを生成し、出力を有限個のビンに離散化することで、異なる群衆シナリオを暗黙的にモデル化する。
  • 密度マップにおける標準的な回帰損失を用いて、特徴学習とシナリオに適応した統合の両方を一括して最適化できるように、ネットワーク全体をエンド・ツー・エンドで学習する。
  • 空間解像度を維持し、多スケールの文脈を捉えるために、バックボーンにドーナツ型畳み込み(dilated convolutions)を適用する。
  • 入力画像の特徴に応じて、最も関連性の高いパスウェイをモデルが適応的に強調できる学習可能な統合戦略を採用する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、明示的なシナリオアノテーションがなくても、多様な群衆シナリオを暗黙的に発見し、それに適応できるか?
  • RQ2群衆計数における固定または手動選択された統合と比較して、多スケール特徴の動的で学習可能な統合は、どのように性能を向上させるか?
  • RQ3統合重みの離散化は、変動する群衆密度や撮影条件に対して一般化性能をどの程度向上させるか?
  • RQ4提案された適応的シナリオ発見フレームワークは、標準ベンチマークで既存のマルチブランチ群衆計数モデルを上回る性能を示すか?
  • RQ5性能は、離散化ビンの数やグループ化されたシナリオ数に対してどの程度感度を示すか?

主な発見

  • 提案された ASD フレームワークは、ShanghaiTech Part A で MAE 65.6 を達成し、CSRNet(MAE 68.2)および Switching-CNN(MAE 90.4)を上回った。
  • ShanghaiTech Part B では、報告済みで最も良い MAE 8.5 と MSE 13.7 を達成し、中程度の混雑度群衆において優れた一般化性能を示した。
  • 極めて挑戦的な UCF_CC_50 データセットでは、前回の SOTA と比較して MAE を 26.3%、MSE を 31.8% 減少させ、高密度シーンへのロバストネスの向上を示した。
  • アブレーションスタディの結果、15のシナリオに離散化された学習可能な統合が最良の性能(MAE 65.6)を示し、非離散化統合(MAE 69.4)や2ビン離散化(MAE 74.4)を上回った。
  • 定性的な結果では、モデルが視覚的特徴(視点、背景、群衆密度など)に基づいて画像を明確に異なるシナリオにグループ化していることが、図5に可視化された。
  • アーキテクチャの変化に対してロバストであることが確認され、両方のパスウェイと適応的統合ブランチが併用されている場合にのみ性能向上が得られ、完全なアーキテクチャの必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。