[論文レビュー] CrowdMLP: Weakly-Supervised Crowd Counting via Multi-Granularity MLP
CrowdMLPは、密度マップのアノテーションに代わる計数レベルのアノテーションのみを用いて、総数を回帰する弱教師付きの集団数え上げ手法を提案する。マルチスケールMLP回帰器によりグローバルな依存関係をモデル化し、一般化を向上させるために自己教師付きプロキシタスク(Split-Counting)を活用する。この手法は、密度マップアノテーションを必要としないにもかかわらず、最新の位置レベルの教師付き手法と同等の性能を達成する。
Existing state-of-the-art crowd counting algorithms rely excessively on location-level annotations, which are burdensome to acquire. When only count-level (weak) supervisory signals are available, it is arduous and error-prone to regress total counts due to the lack of explicit spatial constraints. To address this issue, a novel and efficient counter (referred to as CrowdMLP) is presented, which probes into modelling global dependencies of embeddings and regressing total counts by devising a multi-granularity MLP regressor. In specific, a locally-focused pre-trained frontend is cascaded to extract crude feature maps with intrinsic spatial cues, which prevent the model from collapsing into trivial outcomes. The crude embeddings, along with raw crowd scenes, are tokenized at different granularity levels. The multi-granularity MLP then proceeds to mix tokens at the dimensions of cardinality, channel, and spatial for mining global information. An effective proxy task, namely Split-Counting, is also proposed to evade the barrier of limited samples and the shortage of spatial hints in a self-supervised manner. Extensive experiments demonstrate that CrowdMLP significantly outperforms existing weakly-supervised counting algorithms and performs on par with state-of-the-art location-level supervised approaches.
研究の動機と目的
- 位置レベル(密度マップ)のアノテーションにかかるコストを削減するため、高価な位置レベルのアノテーションの必要性を排除すること。
- 総計ラベルのみで学習する弱教師付き環境において、良好な一般化性能を示す回帰モデルの開発。
- 計数レベル学習における空間的監視の欠如に起因する性能低下を緩和すること。
- 空間的制約を暗黙的に分離し、特徴学習を向上させる自己教師付きプロキシタスクの導入。
- 容易に入手可能な計数レベルアノテーションを用いて、スケーラブルな大規模データセットの構築を可能にすること。
提案手法
- 局所的特徴に焦点を当てた事前学習済みのCNNフロントエンドが、モデルの崩壊を防ぐために内在的な空間的ヒントを保持した低レベル特徴を抽出する。
- 入力画像と特徴マップを複数のスケール(基数、チャネル、空間)でトークン化し、階層的なトークン系列を構築する。
- マルチスケールMLP回帰器が次元を跨いでトークンを混合することで、長距離のグローバル依存関係を捉え、グローバルな文脈をモデル化する。
- 自己教師付きプロキシタスクとして、画像を領域に分割し、部分的な計数を予測する「Split-Counting」を導入する。
- 高レベルのMLPヘッドを用いて、グローバルな埋め込みから直接連続的な計数値を予測する。
- T-SNE可視化を用いて、学習された特徴表現を分析し、シーンタイプや密度に基づくクラスタリングの有無を評価する。

実験結果
リサーチクエスチョン
- RQ1弱教師付き環境下で、完全にMLPベースのアーキテクチャが集団数え上げのグローバルな文脈を効果的にモデル化できるか?
- RQ2マルチスケールトークン混合は、標準的なMLPやCNNと比較して、性能をどのように向上させるか?
- RQ3空間的監視が欠如する状況下で、自己教師付きのSplit-Countingプロキシタスクが誤差をどれほど低減し、一般化性能を向上させるか?
- RQ4計数レベルラベルでのみ学習したモデルが、密度マップの完全な監視で学習したモデルと同等の性能を達成できるか?
- RQ5多様なシーンにおけるスケール変動、密度のシフト、意味的変化に対して、モデルはどの程度適応できるか?
主な発見
- CrowdMLPは、ShanghaiTech Part Aで平均絶対誤差(MAE)57.828を達成し、最新の位置レベルの教師付きモデルと同等の性能を示した。
- 同じパrameter予算下で、CNNベース(Crowd-CNN)およびTransformerベース(Crowd-Transformer)のベースラインを上回った。
- Split-Countingプロキシタスクの導入により、MAEが0.55%、MSEが0.32%改善され、実験的誤差低減の有効性が確認された。
- T-SNE可視化から、モデルが識別性が高くシーンに依存する特徴を学習しており、高密度画像が一団にクラスタリングされ、シーンの意味論に基づいて明確なグループが形成されていることが示された。
- スライディングウィンドウ推論により、CrowdMLPが前景の人物と背景を区別でき、1枚の画像内で急激なスケールや密度の変化に対しても適応可能であることが示された。
- パrameter数26.63Mで強力な性能を発揮し、より大きな36.43Mパラメータを持つTransformerベースのバージョンを上回った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。