Skip to main content
QUICK REVIEW

[論文レビュー] CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model

Dingkang Liang, Jiahao Xie|arXiv (Cornell University)|Apr 9, 2023
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

CrowdCLIPは、サイズ順にソートされた集団パッチ上でマルチモーダルランク損失を用いて画像エンコーダーを微調整し、推論時に段階的なフィルタリング戦略を採用することで、対照的事前学習済み視覚言語モデル(CLIP)を活用した教師なし集団数え上げフレームワークを提案する。これは、UCF-QNRFで前人最高の手法(CSS-CCNN)よりもMAEで35.2%の相対的改善を達成し、クロスデータセット設定下でも一部の完全教師ありモデルを上回る最先端の性能を発揮する。

ABSTRACT

Supervised crowd counting relies heavily on costly manual labeling, which is difficult and expensive, especially in dense scenes. To alleviate the problem, we propose a novel unsupervised framework for crowd counting, named CrowdCLIP. The core idea is built on two observations: 1) the recent contrastive pre-trained vision-language model (CLIP) has presented impressive performance on various downstream tasks; 2) there is a natural mapping between crowd patches and count text. To the best of our knowledge, CrowdCLIP is the first to investigate the vision language knowledge to solve the counting problem. Specifically, in the training stage, we exploit the multi-modal ranking loss by constructing ranking text prompts to match the size-sorted crowd patches to guide the image encoder learning. In the testing stage, to deal with the diversity of image patches, we propose a simple yet effective progressive filtering strategy to first select the highly potential crowd patches and then map them into the language space with various counting intervals. Extensive experiments on five challenging datasets demonstrate that the proposed CrowdCLIP achieves superior performance compared to previous unsupervised state-of-the-art counting methods. Notably, CrowdCLIP even surpasses some popular fully-supervised methods under the cross-dataset setting. The source code will be available at https://github.com/dk-liang/CrowdCLIP.

研究の動機と目的

  • 点レベルのアノテーションが高価であるため、教師あり集団数え上げ手法の高いアノテーションコストを低減すること。
  • 既存の弱教師あり・半教師あり手法の限界を克服し、人為的アノテーションを一切排除すること。
  • CLIPのような視覚言語事前学習モデルが、カウントレベルや点レベルのラベルを一切使用しない教師なし集団数え上げにどのように活用できるかを検討すること。
  • 微調整と構造化された推論により、ゼロショットCLIPの集団数え上げにおける性能を向上させること。
  • ラベル付きデータに依存せず、多様な集団シーンに強く一般化する、堅牢でスケーラブルな手法を開発すること。

提案手法

  • サイズ順にソートされた集団パッチを記述するランク付きテキストプロンプト(例:'20'、'55'、'90'、'125'、'160'、'195')を構築し、画像エンコーダーの微調整に向けたマルチモーダルランク損失を形成する。
  • ランク損失を用いてCLIPの画像エンコーダーのみを微調整し、集団の意味的特徴や密度パターンの理解を向上させる。
  • 推論時に3段階の段階的フィルタリング戦略を適用する:(1) コarse分類で候補パッチを選択し、(2) ファイン分類で選択を精緻化し、(3) テキスト埋め込み類似度を用いてカウント区間へマッピングする。
  • 推論中にテキストエンコーダーを固定し、事前学習済み言語の先行知識を保持し、画像特徴とカウント記述の安定した整合性を確保する。
  • CLIPの画像エンコーダーを用いてパッチを埋め込み、カウント区間のテキスト埋め込みとのコサイン類似度を計算し、最終的なカウントを予測する。
  • パッチ数とプロンプト構成を設計し、性能と頑健性のバランスを図り、1枚の画像あたり4〜5パッチが最適な性能を発揮する。

実験結果

リサーチクエスチョン

  • RQ1CLIPのような視覚言語事前学習モデルが、人為的アノテーションデータを一切使用せずに教師なし集団数え上げに効果的に適応可能か?
  • RQ2ゼロショットCLIPが集団数え上げで失敗する理由は何か?このタスクに直接適用する際の主な制限要因は何か?
  • RQ3マルチモーダルランク損失は、密度が異なる集団パッチを区別する能力を画像エンコーダーが向上させるか?
  • RQ4推論時に段階的フィルタリング戦略を採用することで、顕著な頭部が見えないような曖昧なパッチの影響を軽減し、最終的なカウント精度を向上できるか?
  • RQ5テキストエンコーダーを固定したまま画像エンコーダーのみを微調整することで、元のCLIPモデルよりも高い性能が得られるか?

主な発見

  • CrowdCLIPはUCF-QNRFデータセットにおいて、前回の教師なし最先端手法(CSS-CCNN)と比較してMAEで35.2%の相対的改善を達成し、MAEは283.3(CSS-CCNNは441.0)を記録した。
  • クロスデータセット評価下でも、CSRNet や SANet といった完全教師あり最先端手法を上回り、ラベル付きデータを一切使用しないにもかかわらず強力な一般化性能を示した。
  • テキストエンコーダーを固定したまま画像エンコーダーのみを微調整した場合が最良の性能(MAE = 283.3)を示したが、テキストエンコーダーも微調整すると精度が著しく低下した。
  • 推論における最適なパッチ数は4または5であり、それぞれMAEが283.3および305.2に低下し、ゼロショットCLIP(MAE = 414.7)および3パッチのベースラインを上回った。
  • 訓練データを増やすほど性能が着実に向上し、ShanghaiTech Part Aなどの追加データを活用することでさらに精度が向上した。これは、教師なしアプローチのスケーラビリティを示している。
  • 本手法は多様なデータセットに強く一般化し、UCF-QNRF、ShanghaiTech、NWPU-Crowdを含む5つの挑戦的ベンチマークで一貫した改善を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。