Skip to main content
QUICK REVIEW

[論文レビュー] Scene-Adaptive Attention Network for Crowd Counting

Xing Wei, Yuanrui Kang|arXiv (Cornell University)|Dec 31, 2021
Video Surveillance and Tracking Methods被引用数 8
ひとこと要約

本論文は、変形可能アテンション機構をTransformerバックボーン内で使用することで、変動する人混みのスケールやシーン構成に動的に適応するサンプリング位置とアテンション重みを学習する、シーンに適応するアテンションネットワーク(SAANet)を提案する。この手法は、既存のCNNおよびTransformerベースのモデルと比較して、精度と効率性を向上させ、NWPU-Crowdベンチマークで最先端の性能を達成した。

ABSTRACT

In recent years, significant progress has been made on the research of crowd counting. However, as the challenging scale variations and complex scenes existed in crowds, neither traditional convolution networks nor recent Transformer architectures with fixed-size attention could handle the task well. To address this problem, this paper proposes a scene-adaptive attention network, termed SAANet. First of all, we design a deformable attention in-built Transformer backbone, which learns adaptive feature representations with deformable sampling locations and dynamic attention weights. Then we propose the multi-level feature fusion and count-attentive feature enhancement modules further, to strengthen feature representation under the global image context. The learned representations could attend to the foreground and are adaptive to different scales of crowds. We conduct extensive experiments on four challenging crowd counting benchmarks, demonstrating that our method achieves state-of-the-art performance. Especially, our method currently ranks No.1 on the public leaderboard of the NWPU-Crowd benchmark. We hope our method could be a strong baseline to support future research in crowd counting. The source code will be released to the community.

研究の動機と目的

  • 人混みカウントにおける固定受容 field を持つCNNと窓サイズ固定のアテンションを有するTransformerの限界を克服すること。
  • アノテーション付きバウンディングボックスに依存せずに、シーンのレイアウトやオブジェクトのスケール変動に適応可能な柔軟なアテンション機構を開発すること。
  • マルチレベル特徴マッピング統合とカウントに適応した特徴強化モジュールを用いて、特徴表現と密度推定を向上させること。
  • 計算コストとモデルパラメータ数を削減しつつ、最先端の性能を達成すること。

提案手法

  • 可学習なサンプリングオフセットと動的アテンション重みを用いて、適応的特徴表現を学習するため、変形可能アテンションとグローバルアテンションを組み合わせた新規なTransformerバックボーン「Deformer」を導入する。
  • 変形可能アテンションを採用することで、空間的に適応的な特徴集約を可能にし、視覚的歪みやスケール変動のより良いモデリングが可能になる。
  • 異なる段階の特徴を効率的に統合するため、変形可能アテンションを用いたマルチレベル特徴統合(MFF)モジュールを提案する。これにより、局所化精度とカウント精度が向上する。
  • カウント損失の監視を用いて学習されたアテンションマップで特徴を再キャリブレーションする、スタックされたTransformerデコーダ層からなるカウントに適応した特徴強化(CAFE)モジュールを導入する。
  • Deformerでは、局所的変形可能アテンションとグローバルアテンションを交互に使用するハイブリッドアテンション戦略を採用し、効率性と表現力のバランスを図る。
  • 最終的なカウントのために、標準的な密度回帰ヘッドにL1/L2損失を適用し、提案されたコンponentsと共同でエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1Transformerバックボーン内に変形可能アテンション機構を導入することで、大規模なスケール変動と複雑なシーン下でも人混みカウントの特徴表現が向上するか?
  • RQ2提案されたDeformerバックボーンは、固定サイズ窓アテンションおよび標準的自己アテンションと比較して、適応性と性能において優れているか?
  • RQ3マルチレベル特徴統合とカウントに適応した特徴強化は、カウント精度と局所化精度をどの程度向上させるか?
  • RQ4提案手法は、最小限のアーキテクチャ的仮定のもとで、多様な人混みカウントベンチマークに一般化可能か?
  • RQ5既存の最先端手法と比較して、計算コストとパラメータ数を低減しつつ、最先端の性能を達成できるか?

主な発見

  • SAANetはNWPU-Crowdベンチマークで最高の性能を発揮し、公式リーダーボードでMAE 51.7、MSE 80.1という成績で第1位を獲得した。
  • Deformerバックボーンは、Twins-large や Twins-base よりも大きなモデルであるにもかかわらず、優れたパラメータ効率性と正確性を示した。
  • マルチレベル特徴統合(MFF)モジュールは、単一レベルベースラインと比較してMAEを0.6、MSEを2.1削減した。
  • カウントに適応した特徴強化(CAFE)モジュールは、ベースラインと比較してMAEを1.0、MSEを3.1削減した。
  • MFFとCAFEの組み合わせは、ベースラインと比較してMAEを2.1、MSEを6.2削減し、最高の性能を達成した。
  • 可視化により、変形可能アテンションのサンプリングポイントとオフセットが、アノテーションなしでもオブジェクトのスケールと正の相関を示していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。