Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Resolution Fusion and Multi-scale Input Priors Based Crowd Counting

Usman Sajid, Wenchi Ma|arXiv (Cornell University)|2020. 10. 04.
Video Surveillance and Tracking Methods참고 문헌 37인용 수 8
한 줄 요약

이 논문은 패치 재스케일링 모듈(PRM)을 제거하고 다중 해상도 융합 및 다중 스케일 입력 사전 지식 기반의 군중 수세기 네트워크를 제안한다. 이는 군중 밀도 분류가 필요 없이 정확도를 향상시키기 위해 상향, 하향, 원본 스케일의 세 가지 스케일된 입력 사전 지식을 사용한다. 다중 컬럼 아키텍처와 상호 컬럼 특징 융합, 보조 회귀 헤드를 활용하여 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, RMSE에서 뚜렷한 향상이 이루어졌다.

ABSTRACT

Crowd counting in still images is a challenging problem in practice due to huge crowd-density variations, large perspective changes, severe occlusion, and variable lighting conditions. The state-of-the-art patch rescaling module (PRM) based approaches prove to be very effective in improving the crowd counting performance. However, the PRM module requires an additional and compromising crowd-density classification process. To address these issues and challenges, the paper proposes a new multi-resolution fusion based end-to-end crowd counting network. It employs three deep-layers based columns/branches, each catering the respective crowd-density scale. These columns regularly fuse (share) the information with each other. The network is divided into three phases with each phase containing one or more columns. Three input priors are introduced to serve as an efficient and effective alternative to the PRM module, without requiring any additional classification operations. Along with the final crowd count regression head, the network also contains three auxiliary crowd estimation regression heads, which are strategically placed at each phase end to boost the overall performance. Comprehensive experiments on three benchmark datasets demonstrate that the proposed approach outperforms all the state-of-the-art models under the RMSE evaluation metric. The proposed approach also has better generalization capability with the best results during the cross-dataset experiments.

연구 동기 및 목표

  • 패치 재스케일링 모듈(PRM)의 한계를 해결하기 위해, 비용이 많이 들고 정확도가 떨어지는 군중 밀도 분류가 필요하며, 입력 패치당 하나의 재스케일링만 사용하는 문제를 해결한다.
  • 오염, 시점 변화, 조명 변화와 같은 어려운 조건에서도 다양한 군중 밀도에 대해 일반화 능력을 향상시킨다.
  • PRM를 대체할 수 있는 더 효과적이고 엔드 투 엔드로 훈련 가능한 입력 사전 지식 메커니즘을 도입하여 상향, 하향, 원본 스케일의 세 가지 재스케일링 수준을 동시에 활용한다.
  • 각 단계에서 특징 수준 융합과 보조 회귀 헤드를 통해 훈련 및 예측 정확도를 향상시키기 위해 다중 컬럼 아키텍처를 활용하여 성능을 향상시킨다.

제안 방법

  • 입력 패치의 상향 스케일링(I₁), 원본(I₂), 하향 스케일링(I₃)의 세 가지 입력 사전 지식을 도입하며, 이는 분류 없이 원본 이미지에서 직접 유도된다.
  • 세 단계 네트워크를 구현하며, 각 컬럼 브랜치는 특정 군중 밀도 스케일(저밀도, 중밀도, 고밀도)에 특화되어 있어 다중 해상도 특징 학습을 가능하게 한다.
  • 각 단계에서 컬럼 간 공유된 특징을 통해 다중 해상도 융합을 실현하여, 교차 스케일 특징 향상과 더 나은 표현 학습을 가능하게 한다.
  • 각 단계의 끝에 세 개의 보조 회귀 헤드(RH₁, RH₂, RH₃)를 배치하여 훈련을 감독하고 특징 학습을 안정화시키며, 최종 회귀 성능을 향상시킨다.
  • Phase 2와 Phase 3에서 잔차 모듈(RMs)을 사용하며, 각 컬럼에 두 개의 RM을 배치하여 특징 학습을 깊이 있게 하면서도 기울기 흐름을 유지한다.
  • 최종 헤드와 보조 헤드에서 L1 및 L2 손실을 사용하여 전체 네트워크를 엔드 투 엔드로 훈련하며, 군중 수 세기 회귀 최적화를 목표로 한다.

실험 결과

연구 질문

  • RQ1PRM 모듈을 다중 스케일 입력 사전 지식으로 대체하면 군중 수세기 정확도를 향상시킬 수 있을까? 이때 추가적인 군중 밀도 분류가 필요하지 않은가?
  • RQ2여러 컬럼 간 다중 해상도 융합은 다변동성이 큰 군중 밀도 이미지에서 성능을 어떻게 향상시키는가?
  • RQ3보조 회귀 헤드는 최종 군중 수 예측의 안정성과 정확도에 얼마나 기여하는가?
  • RQ4교차 데이터셋 평가에서 제안된 방법은 최신 기술 수준의 모델보다 더 잘 일반화되는가?
  • RQ5세 가지 입력 사전 지식(상향, 하향, 원본 스케일)이 모델의 전체 성능에 얼마나 핵심적인가?

주요 결과

  • 상하이테크 Part-A 데이터셋에서 제안된 방법(v5)은 RMSE 81.0을 기록하여 이전 최고 성능(86.2) 대비 6% 향상되어 RMSE 기준으로 뛰어난 성능을 보였다.
  • UCF-QNRF 데이터셋에서 RMSE는 305에서 278로 8.9% 향상되었고, MAE는 219에서 201로 8.2% 감소하여 교차 데이터셋 평가에서 강력한 일반화 능력을 입증했다.
  • AHU-Crowd 데이터셋에서 RMSE 91.7, MAE 60.2를 기록하여 이전 최고 성능 대비 RMSE 10% 향상, MAE 9.6% 감소를 기록하여 뚜렷한 성능 향상을 보였다.
  • 제거 실험 결과, 세 입력 사전 지식 중 어느 하나라도 제거하면 MAE는 최소 9.1%, RMSE는 최소 20.1% 감소함을 확인하여 그 중요성을 입증했다.
  • 세 보조 회귀 헤드 중 어느 하나라도 제거하면 MAE는 최소 11.9% 증가하고, RMSE는 최대 29.7% 증가하여 훈련 안정성과 정확도 향상에 중요한 역할을 함을 확인했다.
  • 각 컬럼에 두 개의 잔차 모듈(RMs)을 사용하는 것이 최적의 구성이며, 한 개 또는 세 개로 변경할 경우 성능이 심각하게 저하되며, RMSE는 최대 27.3% 증가함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.