[論文レビュー] Revisiting Crowd Counting: State-of-the-art, Trends, and Future Perspectives
本論文は、2020年から2023年までの最新の研究動向を網羅的に調査し、CNNおよびトランスフォーマーに基づくアーキテクチャ、損失関数、評価指標、モデル設計のトレンドに焦点を当てた包括的なサーベイを提供している。主なベンチマークデータセット(ShanghaiTech、UCSD、Mall)における性能で顕著なモデルを分類・順位付けし、モデルの複雑さ、ドメイン一般化、実運用における精度と効率のトレードオフといった主な課題を特定している。
Crowd counting is an effective tool for situational awareness in public places. Automated crowd counting using images and videos is an interesting yet challenging problem that has gained significant attention in computer vision. Over the past few years, various deep learning methods have been developed to achieve state-of-the-art performance. The methods evolved over time vary in many aspects such as model architecture, input pipeline, learning paradigm, computational complexity, and accuracy gains etc. In this paper, we present a systematic and comprehensive review of the most significant contributions in the area of crowd counting. Although few surveys exist on the topic, our survey is most up-to date and different in several aspects. First, it provides a more meaningful categorization of the most significant contributions by model architectures, learning methods (i.e., loss functions), and evaluation methods (i.e., evaluation metrics). We chose prominent and distinct works and excluded similar works. We also sort the well-known crowd counting models by their performance over benchmark datasets. We believe that this survey can be a good resource for novice researchers to understand the progressive developments and contributions over time and the current state-of-the-art.
研究の動機と目的
- 2020年から2023年までの群衆数把握分野における最も影響力のある進展を体系的かつ最新の状況に即したレビューを提供すること。
- ShanghaiTech、UCSD、Mall などの主要なベンチマークデータセットを用いて、最先端モデルの性能に基づき、それらを分類・順位付けすること。
- 従来のCNNをはるかに超える、トランスフォーマーに基づくモデル、新しい損失関数、評価指標といった新たなトレンドを分析すること。
- クロスシーン一般化の欠如や、精度の向上に見合わないモデルの複雑化といった、重要な研究ギャップを特定すること。
- 応用分野に応じたモデル設計、ドメイン適応、汎用的群衆数把握モデルの実現可能性に関する知見を提示し、今後の研究を導くこと。
提案手法
- モデルアーキテクチャ(例:CNN、トランスフォーマー)、学習パラダイム(損失関数)、評価指標ごとに群衆数把握の研究を分類すること。
- 重複または類似した研究を除き、最も影響力があり特徴的な貢献のみを厳選して分析すること。
- 標準的なデータセット(ShanghaiTech、UCSD、Mall)上でモデルをベンチマーク化し、MSE や MAE に基づいて性能順に順位付けすることで、現在のSOTAを反映すること。
- 深層モデル対浅層モデルの傾向を分析し、精度と推論効率のトレードオフを評価すること。
- ファインチューニングやトランスファー学習のアプローチをレビューすることで、ドメイン適応とクロスシーン一般化の役割を調査すること。
- パラメータ数や計算効率の観点から、CNNベースとビジョントランスフォーマーに基づくモデルの性能を比較すること。

実験結果
リサーチクエスチョン
- RQ12020年から2023年の間で、群衆数把握分野における最も顕著なアーキテクチャ的および訓練手法の進歩は何か?
- RQ2新しい損失関数や評価指標は、群衆数把握におけるモデルの性能と一般化能力をどのように向上させるか?
- RQ3トランスフォーマーに基づくモデルはCNNをどの程度上回っているのか、その効率的トレードオフは何か?
- RQ4精度の向上が最小限であるにもかかわらず、なぜモデルの複雑さが継続的に増大しているのか、実運用への影響は何か?
- RQ5汎用的群衆数把握モデルを構築できるのか、それとも多様な展開環境においては応用分野に特化したモデル設計がより効果的なのか?
主な発見
- 大規模な群衆数把握ベンチマークにおいて、パラメータ数が多くても(例:ViT-base では8600万パラメータ)視覚的トランスフォーマーはCNNに比べて顕著な精度向上を示していない。
- スパarsな群衆データセット(例:UCSD、Mall、ShanghaiTech Part B)では浅層モデルが十分に高い性能を発揮しており、深層アーキテクチャが常に必要というわけではない。
- 最近のモデルは、モデルの複雑さが著しく増加している一方で、精度の向上はわずかであり、訓練および推論効率のより良いベンチマーク化の必要性が浮き彫りになっている。
- クロスシーン一般化は依然として大きな課題であり、多くのモデルが自身の学習ドメインでのみ良好に動作し、未学習のシーンや監視タイプでは失敗する。
- エッジデバイス向けの軽量モデルと、サーバー基盤で高精度を求める密なモデルへの応用分野に特化したモデル設計の傾向が顕著になっている。
- 現代の群衆数把握アーキテクチャには明確な設計パターンが欠如しており、性能向上の要因となるコンponentの特定が困難になっており、イノベーションと再現性の阻害要因となっている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。