[論文レビュー] Boosting Crowd Counting via Multifaceted Attention
本稿では、学習可能な局所注意、局所注意正則化、インスタンスレベルの注意監督を導入することで、極めて多様なシーンにおける集団数の推定を向上させるためのマルチフェイズ注意ネットワーク(MAN)を提案する。MANは4つのベンチマークデータセットで最先端の性能を達成し、ベースライン手法と比較してMAEを最大15.1%、MSEを12.9%低減した。
This paper focuses on the challenging crowd counting task. As large-scale variations often exist within crowd images, neither fixed-size convolution kernel of CNN nor fixed-size attention of recent vision transformers can well handle this kind of variation. To address this problem, we propose a Multifaceted Attention Network (MAN) to improve transformer models in local spatial relation encoding. MAN incorporates global attention from a vanilla transformer, learnable local attention, and instance attention into a counting model. Firstly, the local Learnable Region Attention (LRA) is proposed to assign attention exclusively for each feature location dynamically. Secondly, we design the Local Attention Regularization to supervise the training of LRA by minimizing the deviation among the attention for different feature locations. Finally, we provide an Instance Attention mechanism to focus on the most important instances dynamically during training. Extensive experiments on four challenging crowd counting datasets namely ShanghaiTech, UCF-QNRF, JHU++, and NWPU have validated the proposed method. Codes: https://github.com/LoraLinH/Boosting-Crowd-Counting-via-Multifaceted-Attention.
研究の動機と目的
- 固定受容 field を持つCNNや固定サイズの注意機構を有するビジョントランスフォーマーの性能を低下させる、集団画像における大規模な変動の課題に対処する。
- 特徴位置ごとに動的で学習可能な領域注意に置き換えることで、ビジョントランスフォーマーにおける局所的空間符号化を向上させる。
- 異なる特徴位置間の注意重みの乖離を最小化する新しい局所注意正則化(LAR)を用いて、特徴位置間での注意割り当てをバランスさせる。
- 集団数の推定において、ノイズが多いまたは疎なポイントアノテーションの悪影響を軽減するため、トレーニング中に最も信頼性の高いインスタンスに注目する動的インスタンス注意を導入する。
- 最小限の計算コスト増加で、複数の標準的集団数ベンチマークで最先端の性能を達成する。
提案手法
- 標準的なビジョントランスフォーマーにおける固定サイズのパッチに基づく注意を置き換える、各特徴位置に対して固有の受容領域を学習する動的局所注意機構「学習可能な領域注意(LRA)」を提案する。
- 異なる特徴位置間の注意重みの乖離をペナルティ化する訓練損失である「局所注意正則化(LAR)」を導入し、バランスの取れた効率的な注意割り当てを促進する。
- トレーニング中に低品質またはノイズの多いポイントアノテーションを動的に抑制するため、最も一貫性のある予測にのみ注目する「インスタンス注意損失(IAL)」を設計する。
- LRA、LAR、IALを統合した統一されたトランスフォーマー基盤の数え上げフレームワークを構築し、グローバル自己注意に加え、適応的局所およびインスタンスレベルの注意を組み合わせる。
- CNNバックボーンで特徴を抽出し、LRAを備えたトランスフォーマーのエンコーダーを経て、密度マップを予測する回帰ヘッドを用いる。
- 標準的な回帰損失に加え、提案されたIALおよびLAR損失を組み合わせて、モデル全体をエンドツーエンドで最適化する。
実験結果
リサーチクエスチョン
- RQ1学習可能で動的な局所注意機構は、集団数の推定におけるビジョントランスフォーマーの局所的コンテキスト符号化を向上させることができるか?
- RQ2LARによる特徴位置間の注意分布の正則化は、より強固でバランスの取れた注意割り当てをもたらすか?
- RQ3動的インスタンスレベルの注意は、ノイズが多いまたは疎なポイントアノテーションに対してモデルのロバスト性を向上させることができるか?
- RQ4グローバル・ローカル・インスタンスレベルの注意機構を組み合わせることで、多様な集団数ベンチマークで一貫した性能向上が得られるか?
- RQ5提案されたMANは、既存のCNNおよびビジョントランスフォーマー基盤の集団数推定モデルと比較して、効率性と正確性の両面で優れているか?
主な発見
- MANはShanghaiTech、UCF-QNRF、JHU++、NWPUの4つの主要な集団数ベンチマークで最先端の性能を達成した。
- UCF-QNRFデータセットにおいて、ベースラインのBL手法と比較して、MAEを15.1%、MSEを12.9%低減した。
- LRAを単体で追加するだけで、ベースラインよりMAEで2.7%、MSEで3.5%の性能向上が得られ、IALと組み合わせることでさらなる向上が得られた。
- 局所注意正則化(LAR)はトレーニングを著しく安定化させ、注意分布を改善し、インスタンス注意損失における最適な性能はδ=0.9で達成された。
- 計算コストは低く抑えられ、ViT-BやVGG19+Transと比較して、FLOPsはわずかに58.2 GFLOPs増加し、推論時間も100枚あたり11.3秒とわずかに増加した。
- 可視化結果から、LRAが小さな集団に対して注意領域を適応的に狭め、人間の注視効率に類似した挙動を示していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。