Skip to main content
QUICK REVIEW

[論文レビュー] Scale-Aware Network with Regional and Semantic Attentions for Crowd Counting under Cluttered Background

Qiaosi Yi, Yunxing Liu|arXiv (Cornell University)|Jan 5, 2021
Video Surveillance and Tracking Methods参考文献 56被引用数 8
ひとこと要約

本論文は、複雑な背景やスケール変動にさらされた状況下でも、正確な混雑度推定を実現するため、領域的および意味的アテンション機構を統合したスケールに敏感な混雑度カウントネットワーク(SACCN)を提案する。U字型のエンコーダ・デコーダアーキテクチャに非対称なマルチスケールモジュール、領域アテンションに基づく密接続およびスキップ接続、および二重アテンションモジュール(RAMおよびSAM)を採用することで、SACCNは複数のベンチマークで最先端の性能を達成し、ShanghaiTechデータセットではMAEを6.8、MSEを10.5まで低減した。

ABSTRACT

Crowd counting is an important task that shown great application value in public safety-related fields, which has attracted increasing attention in recent years. In the current research, the accuracy of counting numbers and crowd density estimation are the main concerns. Although the emergence of deep learning has greatly promoted the development of this field, crowd counting under cluttered background is still a serious challenge. In order to solve this problem, we propose a ScaleAware Crowd Counting Network (SACCN) with regional and semantic attentions. The proposed SACCN distinguishes crowd and background by applying regional and semantic self-attention mechanisms on the shallow layers and deep layers, respectively. Moreover, the asymmetric multi-scale module (AMM) is proposed to deal with the problem of scale diversity, and regional attention based dense connections and skip connections are designed to alleviate the variations on crowd scales. Extensive experimental results on multiple public benchmarks demonstrate that our proposed SACCN achieves satisfied superior performances and outperform most state-of-the-art methods. All codes and pretrained models will be released soon.

研究の動機と目的

  • 実世界の状況下で、複雑な背景や顕著なスケール変動に起因する混雑度カウントの持続的な課題に対処すること。
  • 複雑な視覚的環境下での混雑度推定精度および総数予測精度の向上。
  • 浅い層および深い層の両レベルでアテンション機構を用いて、前景(群衆)と背景を区別することで特徴表現を強化すること。
  • 非対称なマルチスケールモジュールとアテンション誘導型の特徴再利用を組み合わせることで、スケール変動の影響を軽減すること。
  • 統合的アーキテクチャ的革新を通じて、公開の混雑度カウントベンチマークで最先端の性能を達成すること。

提案手法

  • スケールに敏感な混雑度カウントネットワーク(SACCN)を提案し、スケール間での効果的な特徴再利用を可能にするU字型のエンコーダ・デコーダ構造を採用する。
  • 浅い層に領域アテンションモジュール(RAM)を導入し、空間的およびチャネル別アテンションを統合することで、群衆領域を強調する。
  • 深い層に意味的アテンションモジュール(SAM)を設計し、空間的およびチャネル自己アテンションを用いて、群衆と背景の意味的識別を向上させる。
  • 1×3および3×1、または1×5および5×1の畳み込みを用いた非対称なマルチスケールモジュール(AMM)を採用し、パラメータ数を減らしつつも効率的にマルチスケール特徴を捉える。
  • エンコーダ部に領域アテンションに基づく密接続を、エンコーダとデコーダ間のスキップ接続に領域アテンションに基づく接続を組み込むことで、特徴集約を向上させる。
  • 複数段階の特徴統合戦略を採用し、異なる解像度の特徴から得られる補完的情報を活用することで、スケール変動に対するロバスト性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1浅い層および深い層の両方でアテンション機構を効果的に適用することで、複雑な背景からの群衆の区別はどの程度向上するか?
  • RQ2非対称なマルチスケール畳み込みは、モデルの複雑さを軽減しつつも、特徴表現をどの程度向上できるか?
  • RQ3領域アテンションに基づく密接続およびスキップ接続は、スケール変動が顕著な混雑度シーンでの特徴再利用と性能向上にどの程度寄与するか?
  • RQ4RAM、SAM、AMM、および接続モジュールの個々の貢献とそれらの組み合わせによる、複雑な背景およびスケール変動への耐性向上への寄与は何か?
  • RQ5統合されたネットワークアーキテクチャは、困難な現実世界の条件下で複数の公開ベンチマークで優れた性能を達成できるか?

主な発見

  • 提案されたSACCNは、ShanghaiTechデータセットでMAEが6.8、MSEが10.5に達し、大多数の最先端手法を上回る性能を示した。
  • アブレーションスタディの結果、RAMやSAMを削除すると顕著な性能低下が生じ、これらが群衆と背景の区別に果たす重要な役割が裏付けられた。
  • AMMにおける非対称畳み込みの使用により、パラメータ数を削減しながらも性能を維持でき、標準の3×3や5×5畳み込みに比べて効率性の向上が確認された。
  • 密接続やスキップ接続を削除すると精度が低下し、勾配消失の緩和および特徴表現の強化においてこれらが重要であることが確認された。
  • 可視化結果から、SACCNが生成する密度マップは、ベースラインモデルと比較して、特に複雑でスケールが多様な領域において真値に著しく近いことが示された。
  • RAM、SAM、AMM、およびアテンションに基づく接続の組み合わせが最良の性能を達成しており、各モジュールが複雑な背景およびスケール変動への耐性向上に独自に貢献していることが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。