[論文レビュー] Congested Crowd Instance Localization with Dilated Convolutional Swin Transformer
本論文は、極度に混雑した群衆シーンにおける正確なインスタンスローカライゼーションのための拡張畳み込みスウィン変換器(DCST)を提案する。スウィン変換器のバックボーンに拡張畳み込みを統合することで、大規模な受容 field を持つ文脈特徴の学習を強化する。本手法は、ベンチマークデータセット上で F1 スコア 77.5%、MAE 84.2 を達成し、遮蔽およびぼやけた領域におけるローカライゼーション性能を顕著に向上させた。
Crowd localization is a new computer vision task, evolved from crowd counting. Different from the latter, it provides more precise location information for each instance, not just counting numbers for the whole crowd scene, which brings greater challenges, especially in extremely congested crowd scenes. In this paper, we focus on how to achieve precise instance localization in high-density crowd scenes, and to alleviate the problem that the feature extraction ability of the traditional model is reduced due to the target occlusion, the image blur, etc. To this end, we propose a Dilated Convolutional Swin Transformer (DCST) for congested crowd scenes. Specifically, a window-based vision transformer is introduced into the crowd localization task, which effectively improves the capacity of representation learning. Then, the well-designed dilated convolutional module is inserted into some different stages of the transformer to enhance the large-range contextual information. Extensive experiments evidence the effectiveness of the proposed methods and achieve state-of-the-art performance on five popular datasets. Especially, the proposed model achieves F1-measure of 77.5\% and MAE of 84.2 in terms of localization and counting performance, respectively.
研究の動機と目的
- 極度に混雑した群衆シーンにおける正確なインスタンスレベルのローカライゼーションの課題に取り組む。この状況では、小さな物体、相互遮蔽、画像のぼやけが性能を低下させる。
- 重度の遮蔽およびぼやけの下でも、強力な特徴を抽出できる能力を向上させることで、従来のモデルの限界を克服する。
- 戦略的な拡張畳み込みの統合により、ビジョン変換器の密集群衆シナリオにおける特徴抽出能力を向上させる。
- 複数のベンチマークデータセットにおいて、群衆インスタンスローカライズおよびカウントの最先端性能を達成する。
提案手法
- 群衆シーンにおける階層的かつグローバルローカル表現を捉えるために、窓ベースのスウィン変換器をバックボーンエンコーダとして統合する。
- 受容 field を拡大するために、スウィン変換器のステージ 3 および 4 に、拡張率が 2 および 3 の新しい拡張畳み込みブロック(DCB)を挿入する。
- 各ステージの後で、変換器の特徴マップを空間形式に再編成し、拡張畳み込みの効果的な適用を可能にする。
- インスタンスレベルの予測に適合する入力サイズに一致するフル解像度のセグメンテーションマップを生成するために、特徴ピラミッドネットワーク(FPN)デコーダーを使用する。
- 局所的ディテールを保持しながら、複数スケールにわたる長距離の文脈的依存関係を符号化する柔軟な DCB モジュールを設計する。
- 局所的特徴の最適化と拡張率の最適化を、アブレーションスタディを通じて行い、ローカライズおよびカウントのメトリクスで性能を最大化する。

実験結果
リサーチクエスチョン
- RQ1スウィン変換器アーキテクチャのどの部分に拡張畳み込みブロックを挿入することで、密な群衆におけるローカライズ性能を最大限に高められるか?
- RQ2DCB モジュールにおけるどの拡張率設定が、局所的ディテールの保持と長距離文脈符号化の間で最良のトレードオフを実現するか?
- RQ3しきい値の選択が、群衆インスタンスローカライズにおけるローカライズ F1 スコアとカウント MAE のトレードオフにどのように影響するか?
- RQ4提案された DCST は、標準のスウィン変換器および他の最先端モデルに対して、ベンチマークデータセットでどの程度性能を向上させるか?
主な発見
- 提案された DCST は、5つのベンチマークデータセットで F1 スコア 77.5%、MAE 84.2 を達成し、優れたローカライズおよびカウント性能を示した。
- スウィン変換器のステージ 3 および 4 に DCB を挿入すると最良の性能が得られ、NWPU-Crowd 検証セットで F1 スコア 81.4% を達成した。
- 拡張率 {2, 3} の DCB が最適なバランスを実現し、NWPU データセットで F1 スコア 81.4%、精度 84.1%、再現率 79.0% を達成した。
- しきい値 0.44 が F1 スコア(81.45%)を最大にし、しきい値 0.32 が MAE(38.71)を最小にした。これにより、ローカライズとカウントの目的の間のトレードオフが明らかになった。
- 標準のスウィン変換器および他の SOTA モデルと比較して、特に小さな物体、遮蔽およびぼやけた群衆領域の処理において顕著に優れた性能を示した。
- アブレーションスタディにより、浅い段階(1 および 2)に DCB を挿入すると局所的特徴学習が損なわれることが確認されたが、より深い段階に挿入することで構造的ディテールをより効果的に保持できた。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。