Skip to main content
QUICK REVIEW

[論文レビュー] Crowd Counting Using Scale-Aware Attention Networks

Mohammad Asiful Hossain, Mehrdad Hosseinzadeh|arXiv (Cornell University)|Mar 5, 2019
Video Surveillance and Tracking Methods参考文献 26被引用数 9
ひとこと要約

本稿では、密度マップ推定を向上させるために、複数スケールの特徴を動的に重み付けるソフトアテンションメカニズムを用いたスケールに敏感なアテンションネットワークを提案する。グローバルおよびローカルスケールアテンションモジュールと補助損失を統合することで、ベンチマークデータセットで最先端の性能を達成し、ShanghaiTech PartBではMAEを最大16.86まで低減した。

ABSTRACT

In this paper, we consider the problem of crowd counting in images. Given an image of a crowded scene, our goal is to estimate the density map of this image, where each pixel value in the density map corresponds to the crowd density at the corresponding location in the image. Given the estimated density map, the final crowd count can be obtained by summing over all values in the density map. One challenge of crowd counting is the scale variation in images. In this work, we propose a novel scale-aware attention network to address this challenge. Using the attention mechanism popular in recent deep learning architectures, our model can automatically focus on certain global and local scales appropriate for the image. By combining these global and local scale attention, our model outperforms other state-of-the-art methods for crowd counting on several benchmark datasets.

研究の動機と目的

  • 視覚的および密度的要因により、物体(例:人)が著しく異なるサイズに見えるスケール変動の課題に対処する。
  • スイッチCNNのような離散的スケール選択に依存するハードスイッチング手法の限界を克服する。
  • 複数スケールにわたる特徴を適応的に再重み付けするソフトアテンションメカニズムを導入し、より強固で正確な密度マップ予測を可能にする。
  • グローバルおよびローカルスケールアテンションモジュールが、シーン全体の多様な群衆密度を捉える上で果たす役割を明らかにする。
  • アテンションヘッドに対する補助的监督を用いることで、特徴学習と一般化能力の向上を図る。

提案手法

  • 異なる受容 field サイズを持つ特徴を生成するマルチスケール特徴抽出器を提案する。
  • スケール次元全体にわたってアテンション重みを計算するグローバルスケールアテンション(GSA)モジュールを導入する。
  • 空間的位置ごとにスケールに敏感なアテンションを計算するローカルスケールアテンション(LSA)モジュールを設計する。
  • 学習可能なファージョン層を用いて、マルチスケール特徴とGSAおよびLSAの出力を統合し、最終的な密度マップを生成する。
  • 密度マップにおける主損失 $L_{DM}$ と、アテンションヘッドを監視する補助損失 $L_{GSA}$ および $L_{LSA}$ を用いてモデルを訓練する。
  • 連続的な重みをスケールに割り当てることで、モデルが一度に複数のスケールに注目できるソフトアテンションメカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1アテンションメカニズムは、空間的位置ではなく関連するスケールに注目するために効果的に適応可能か?
  • RQ2アテンションによるソフトスケール選択は、スイッチCNNで用いられるハードスイッチング手法を上回るか?
  • RQ3グローバルおよびローカルスケールアテンションモジュールは、個別および統合的にどのように群衆密度推定を向上させるか?
  • RQ4アテンションヘッドに対する補助的监督は、意味のあるスケール表現を学習する能力を向上させるか?
  • RQ5提案手法は、スケール分布が異なる多様な群衆計数ベンチマークに一般化可能か?

主な発見

  • 提案モデルはShanghaiTech PartBデータセットで平均絶対誤差(MAE)16.86を達成し、すべての先行SOTA手法を上回った。
  • アブレーションスタディにより、グローバル(GSA)およびローカル(LSA)アテンションモジュールの両方が顕著に寄与しており、両方を併用した際が最高の性能を示した。
  • 訓練時に補助損失 $L_{GSA}$ および $L_{LSA}$ を用いることで、さらに性能が向上し、ShanghaiTech PartBにおけるMAEは19.15から16.86に低下した。
  • Mallデータセットでは、MAEが1.28、MSEが1.68を達成し、DecideNet や Count-Forest を含む既存手法を上回った。
  • 図6の定性的な結果から、特に高密度および隠蔽領域において、より正確で詳細な密度マップが生成されていることが示された。
  • 本手法は、ShanghaiTech PartB、Mall、UCF_CC_50の3つのベンチマークデータセットにおいて、すべての既存手法を上回り、一貫した一般化性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。