Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Crowd Counting: State-of-the-art, Trends, and Future Perspectives

Muhammad Asif Khan, Hamid Menouar|arXiv (Cornell University)|2022. 09. 14.
Video Surveillance and Tracking Methods인용 수 5
한 줄 요약

이 논문은 2020~2023년도 동안의 최신 기술 동향을 종합적으로 다루며, CNN 및 트랜스포머 기반 아키텍처, 손실 함수, 평가 지표, 모델 설계 트렌드에 중점을 두고 있다. 주요 벤치마크 데이터셋에서 성능에 따라 주요 모델들을 순위화하고, 모델 복잡성, 도메인 일반화, 실세계 적용에서 정확도와 효율성 간의 상충 관계와 같은 핵심 과제를 밝히고 있다.

ABSTRACT

Crowd counting is an effective tool for situational awareness in public places. Automated crowd counting using images and videos is an interesting yet challenging problem that has gained significant attention in computer vision. Over the past few years, various deep learning methods have been developed to achieve state-of-the-art performance. The methods evolved over time vary in many aspects such as model architecture, input pipeline, learning paradigm, computational complexity, and accuracy gains etc. In this paper, we present a systematic and comprehensive review of the most significant contributions in the area of crowd counting. Although few surveys exist on the topic, our survey is most up-to date and different in several aspects. First, it provides a more meaningful categorization of the most significant contributions by model architectures, learning methods (i.e., loss functions), and evaluation methods (i.e., evaluation metrics). We chose prominent and distinct works and excluded similar works. We also sort the well-known crowd counting models by their performance over benchmark datasets. We believe that this survey can be a good resource for novice researchers to understand the progressive developments and contributions over time and the current state-of-the-art.

연구 동기 및 목표

  • 2020년부터 2023년까지 집단 수세기 분야에서 가장 영향력 있는 기술 발전을 체계적이고 최신 정보를 반영한 리뷰를 제공하는 것.
  • ShanghaiTech, UCSD, Mall과 같은 주요 벤치마크 데이터셋에서 성능에 따라 최신 기술 모델들을 분류하고 순위를 매기는 것.
  • 기존의 CNN을 초월해 트랜스포머 기반 모델, 새로운 손실 함수, 평가 지표 등 새로운 트렌드를 분석하는 것.
  • 크로스-시나리오 일반화 부족과 정확도 향상에 비해 모델 복잡도가 급격히 증가하는 것과 같은 핵심 연구 격차를 식별하는 것.
  • 응용 분야에 맞는 모델 설계, 도메인 적응, 보편적인 집단 수세기 모델의 실현 가능성에 대한 통찰을 제안하여 향후 연구를 이끌어내는 것.

제안 방법

  • 모델 아키텍처(예: CNN, 트랜스포머), 학습 방식(손실 함수), 평가 지표에 따라 집단 수세기 기여를 분류하는 것.
  • 중복되거나 유사한 연구를 제외하고, 가장 영향력 있고 독창적인 기여만을 선별하고 분석하는 것.
  • 표준 데이터셋(ShanghaiTech, UCSD, Mall)에서 모델을 벤치마킹하고, 성능(MSE, MAE)에 따라 순위를 매겨 현재 최고 성능(SOTA)을 반영하는 것.
  • 깊이 있는 모델 대비 浅층 모델의 트렌드를 분석하고, 정확도와 추론 효율성 간의 상충 관계를 평가하는 것.
  • 세부 조정 및 전이 학습 기법을 검토하여 도메인 적응과 크로스-시나리오 일반화의 역할을 분석하는 것.
  • 정확도, 파라미터 수, 계산 효율성 측면에서 CNN 기반 모델과 비전 트랜스포머 기반 모델을 비교하는 것.
Figure 2 : Ground Truth generation for crowd counting models.
Figure 2 : Ground Truth generation for crowd counting models.

실험 결과

연구 질문

  • RQ12020년부터 2023년까지 집단 수세기 분야에서 가장 두드러진 아키텍처 및 학습 방법의 발전은 무엇인가?
  • RQ2새로운 손실 함수와 평가 지표는 집단 수세기에서 모델 성능과 일반화 능력을 어떻게 향상시키는가?
  • RQ3트랜스포머 기반 모델은 CNN에 비해 얼마나 뛰어난 성능을 보이며, 그에 따른 효율성의 상충 관계는 어떠한가?
  • RQ4정확도 향상이 미미한 상황에서도 모델 복잡도가 계속 증가하는 이유는 무엇이며, 실세계 적용에 미치는 영향은 무엇인가?
  • RQ5보편적인 집단 수세기 모델을 개발할 수 있는가, 아니면 다양한 적용 환경에서 응용 분야에 맞는 모델 설계가 더 효과적인가?

주요 결과

  • 비전 트랜스포머는 대규모 집단 수세기 벤치마크에서 CNN에 비해 뚜렷한 정확도 향상을 보여주지 못했으며, 파라미터 수가 많음에도 불구하고(예: ViT-base는 8600만 파라미터) 그러한 성과를 내지 못했다.
  • 얕은 모델은 흩어진 집단 데이터셋(예: UCSD, Mall, ShanghaiTech Part B)에서 충분히 우수한 성능을 보이며, 깊은 아키텍처가 항상 필요한 것은 아님을 시사한다.
  • 최근 모델들은 모델 복잡도가 급격히 증가함에도 불구하고 정확도 향상이 미미한 편이므로, 훈련 및 추론 효율성에 대한 보다 나은 벤치마킹이 필요하다.
  • 크로스-시나리오 일반화는 여전히 주요 과제이며, 대부분의 모델은 자신의 훈련 도메인에서는 잘 작동하지만, 새로운 시나리오나 감시 유형에서는 실패한다.
  • 경량 모델은 엣지 디바이스에 적합하고, 고정밀도가 필요한 서버 기반 시나리오에는 밀도 높은 모델을 사용하는 등 응용 분야에 맞는 모델 설계 경향이 뚜렷해지고 있다.
  • 최근 집단 수세기 아키텍처에는 명확한 설계 패턴이 부족하여 어떤 구성 요소가 성능 향상에 기여하는지 이해하기 어려워지고 있으며, 이는 혁신과 재현 가능성에 장애가 된다.
Figure 3 : Density maps with different scale ( $\sigma$ ) values.
Figure 3 : Density maps with different scale ( $\sigma$ ) values.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.