Skip to main content
QUICK REVIEW

[논문 리뷰] MRCNet: Crowd Counting and Density Map Estimation in Aerial and Ground Imagery

Reza Bahmanyar, Eleonora Vig|arXiv (Cornell University)|2019. 09. 27.
Video Surveillance and Tracking Methods참고 문헌 25인용 수 22
한 줄 요약

이 논문은 항공 및 지상 영상에서 정확한 군중 수 세기와 고해상도 밀도 맵 추정을 위한 다중 해상도 인코더-디코더 CNN인 MRCNet을 제안한다. VGG-16 특징을 활용하고 FPN에 영감을 받은 lateral 연결을 적용하며, 이중 단계 손실을 최적화함으로써, 새로운 DLR-ACD 항공 군중 데이터셋과 상하이테크 CCTV 벤치마크에서 최신 기술(SOTA) 성능을 달성하여 평균 절대 오차와 F1 스코어 측면에서 새로운 SOTA 기록을 수립한다.

ABSTRACT

In spite of the many advantages of aerial imagery for crowd monitoring and management at mass events, datasets of aerial images of crowds are still lacking in the field. As a remedy, in this work we introduce a novel crowd dataset, the DLR Aerial Crowd Dataset (DLR-ACD), which is composed of 33 large aerial images acquired from 16 flight campaigns over mass events with 226,291 persons annotated. To the best of our knowledge, DLR-ACD is the first aerial crowd dataset and will be released publicly. To tackle the problem of accurate crowd counting and density map estimation in aerial images of crowds, this work also proposes a new encoder-decoder convolutional neural network, the so-called Multi-Resolution Crowd Network MRCNet. The encoder is based on the VGG-16 network and the decoder is composed of a set of bilinear upsampling and convolutional layers. Using two losses, one at an earlier level and another at the last level of the decoder, MRCNet estimates crowd counts and high-resolution crowd density maps as two different but interrelated tasks. In addition, MRCNet utilizes contextual and detailed local information by combining high- and low-level features through a number of lateral connections inspired by the Feature Pyramid Network (FPN) technique. We evaluated MRCNet on the proposed DLR-ACD dataset as well as on the ShanghaiTech dataset, a CCTV-based crowd counting benchmark. The results demonstrate that MRCNet outperforms the state-of-the-art crowd counting methods in estimating the crowd counts and density maps for both aerial and CCTV-based images.

연구 동기 및 목표

  • 군중 모니터링 및 관리 분야의 연구를 위해 대규모 항공 군중 데이터셋이 부족한 문제를 해결하기 위해.
  • 도전적인 항공 및 지상 영상에서 정확한 군중 수 세기와 고해상도 밀도 맵 추정이 가능한 딥러닝 모델을 개발하기 위해.
  • 밀도가 높은 군중 장면에서 체적 변화, 가림, 저해상도 사람 형태에 대한 강건성을 향상시키기 위해.
  • 다중 해상도 아키텍처와 맥락 및 국소 특징 융합을 설계하여 항공 및 CCTV 기반 군중 수 세기 간의 전이 학습을 가능하게 하기 위해.
  • 226,291명의 사람이 레이블링된 33장의 이미지로 구성된 DLR 항공 군중 데이터셋(DLR-ACD)을 공개하기 위해.

제안 방법

  • MRCNet는 입력 이미지에서 계층적 특징을 추출하기 위해 VGG-16 기반 인코더를 사용한다.
  • 디코더는 이중선형 보간과 합성곱 레이어를 사용하여 고해상도 밀도 맵을 재구성한다.
  • 두 가지 손실 함수가 적용되며, 하나는 중간 디코더 레이어에서, 다른 하나는 최종 출력 레이어에서 각각 적용되어 군중 수와 밀도 맵 품질을 동시에 최적화한다.
  • 인코더와 디코더 특징 맵 간의 lateral 스킵 연결은 FPN에 영감을 받은 요소별 덧셈을 사용하여 고수준 맥락적 특징과 저수준 세부 특징을 융합한다.
  • 일반화 성능 향상을 위해 무작위 자르기, 회전, 뒤집기, 스케일링을 포함한 데이터 증강 기법을 사용하여 네트워크를 엔드 투 엔드로 훈련한다.
  • 모델은 제안된 DLR-ACD 데이터셋과 표준 상하이테크 벤치마크를 기반으로 하여 도메인 간 전이 가능성에 대해 평가된다.

실험 결과

연구 질문

  • RQ1딥러닝 모델이 항공 및 CCTV 기반 영상에서 모두 군중 수 세기와 밀도 맵 추정에서 최신 기술 성능을 달성할 수 있는가?
  • RQ2lateral 연결을 통한 다중 해상도 특징 융합이 작은 객체 및 서로 가까이 밀집된 객체의 정확도 향상에 얼마나 효과적인가?
  • RQ3항공 영상에서 훈련된 모델이 지상 기반 감시 데이터에 대해 얼마나 잘 일반화되는가, 그 반대의 경우도 마찬가지인가?
  • RQ4제안된 이중 단계 손실 전략은 단일 손실 접근 방식에 비해 수치 추정과 밀도 맵 품질을 모두 향상시키는가?
  • RQ5새로운 대규모 항공 군중 데이터셋이 항공 군중 분석 분야의 연구를 크게 발전시킬 수 있는가?

주요 결과

  • DLR-ACD 데이터셋에서 MRCNet은 0.21의 최저 평균 정규화 절대 오차(MNAE)를 기록하여 모든 기준 모델들을 압도했다.
  • MRCNet은 추정된 밀도 맵에서 사람 검출에 대해 F1 스코어 0.49를 기록하여 비교된 모든 방법들 중에서 가장 높은 성능을 보였다.
  • 상하이테크 Part-A 벤치마크에서 MRCNet은 66.2의 평균 절대 오차(MAE)를 기록하여 모든 최신 기술 방법들 중에서 가장 낮은 수치를 기록했다.
  • MRCNet은 상하이테크 Part-A에서 루트 평균 제곱 오차(RMSE) 102.0을 기록하여, 이 역시 보고된 바 중 최고 수준이었으며, 뛰어난 수치 추정 정확도를 입증했다.
  • 모델의 추론 시간은 256×256 이미지 패치당 0.03 ms에 불과하여, 2030만 개의 파라미터를 가짐에도 불구하고 높은 효율성을 보였다.
  • 정성적 결과에서는 MRCNet이 조밀하고 흩어진 군중 상황 모두에서 고해상도이고 정확한 밀도 맵을 생성하는 것으로 나타났지만, 배경 혼잡으로 인해 일부 작은 객체는 놓치는 경향이 있었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.