Skip to main content
QUICK REVIEW

[論文レビュー] CrowdFormer: Weakly-supervised Crowd counting with Improved Generalizability

Siddharth Singh Savner, Vivek Kanhangad|arXiv (Cornell University)|Mar 7, 2022
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

CrowdFormerは、マルチスケールでグローバルな文脈的情報を捉えるためにピラミッドビジョントランスフォーマー(PVTv2)バックボーンを用いた弱教師付きの集団数え上げ手法を提案する。学習可能な特徴集約モジュールと単純な回帰ヘッドを備え、ベンチマークデータセットで最先端の性能を達成するとともに、クロスデータセット評価において優れた汎化性能を示し、多くの完全教師付き手法を上回る性能を発揮する。

ABSTRACT

Convolutional neural networks (CNNs) have dominated the field of computer vision for nearly a decade due to their strong ability to learn local features. However, due to their limited receptive field, CNNs fail to model the global context. On the other hand, transformer, an attention-based architecture can model the global context easily. Despite this, there are limited studies that investigate the effectiveness of transformers in crowd counting. In addition, the majority of the existing crowd counting methods are based on the regression of density maps which requires point-level annotation of each person present in the scene. This annotation task is laborious and also error-prone. This has led to increased focus on weakly-supervised crowd counting methods which require only the count-level annotations. In this paper, we propose a weakly-supervised method for crowd counting using a pyramid vision transformer. We have conducted extensive evaluations to validate the effectiveness of the proposed method. Our method is comparable to the state-of-the-art on the benchmark crowd datasets. More importantly, it shows remarkable generalizability.

研究の動機と目的

  • 集団数え上げにおけるポイントレベルの密度マップアノテーションの高コストを低減するため、カウントレベルのアノテーションのみを用いた弱教師付き学習を可能にする。
  • 畳み込みニューラルネットワーク(CNN)の受容 field の制限を克服するため、ビジョントランスフォーマーを用いてグローバルな文脈モデリングを強化することで、集団数え上げの性能を向上させる。
  • トランスフォーマーに基づくアーキテクチャにおいてマルチスケール特徴集約機構を設計することで、多様な集団シーンにわたるモデルの汎化性能を向上させる。
  • 特にクロスデータセット評価設定において、最先端の完全教師付き手法と同等または優れた性能を達成することを目的とする。

提案手法

  • 入力画像からグローバルな文脈を有するマルチスケール特徴を抽出するために、事前学習済みのPVTv2バックボーンを採用する。
  • ピラミッドビジョントランスフォーマーの全4段階からの特徴を統合する学習可能な特徴集約モジュールを導入する。
  • 集約された特徴を直接最終的な集団数にマップする単純な回帰ヘッドを用い、密度マップの合計を回避する。
  • 2次元密度マップの監視を不要とするエンドツーエンド学習のため、シーケンスからカウントへのマッピングを適用する。
  • トランスフォーマー内の自己注意機構を活用して、画像全体にわたる長距離の空間的依存関係をモデル化する。
  • 高価なポイントレベルのアノテーションに依存を最小限に抑えるために、画像レベルのカウントアノテーションのみを用いてモデルを訓練する。
Fig. 1 : The pipeline of the proposed CrowdFormer
Fig. 1 : The pipeline of the proposed CrowdFormer

実験結果

リサーチクエスチョン

  • RQ1ビジョントランスフォーマーに基づくアーキテクチャは、カウントレベルのアノテーションのみで、弱教師付き集団数え上げにおいて最先端の性能を達成できるか?
  • RQ2ピラミッドビジョントランスフォーマーを用いたマルチスケール特徴抽出は、単一スケールまたはCNNベースの手法と比較して、多様な集団シーンにおける汎化性能を向上させるか?
  • RQ3提案された特徴集約戦略は、クロスデータセット評価において、既存手法と比較して性能とロバスト性に優れているか?
  • RQ4弱教師付きのトランスフォーマーモデルは、クロスデータセット設定において完全教師付きモデルを上回る性能を発揮できるか?

主な発見

  • SHAデータセットでは、以前の最良の弱教師付き手法と比較して、MAEを3.6%、MSEを0.63%改善し、最先端の性能を達成した。
  • UCF_CC_50データセットでは、弱教師付き手法の中で最も低いMAEを記録し、CCTransを6.3%上回った。
  • クロスデータセット評価においても、最先端の結果を達成し、特にSHAやQNRFのような困難なデータセットで学習した場合、完全教師付き手法ですら上回った。
  • モデルは強力な汎化性能を示し、高密度または複雑なシーンで学習した場合に優れた性能を発揮し、より単純なデータセットへも効果的に転移した。
  • 単一スケール特徴のみを用いるTransCrowdと比較して、CrowdFormerはマルチスケール特徴統合の利点を顕著に示した。
  • 極端な視覚的歪み(例:UCF_CC_50)を含む多様なデータセットにおいても、性能が安定しており、実用的・実装可能性の高さを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。