Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Dense Crowd Counting Convolutional Neural Networks using Inverse k-Nearest Neighbor Maps and Multiscale Upsampling

Greg Olmschenk, Hao Tang|arXiv (Cornell University)|2019. 01. 31.
Video Surveillance and Tracking Methods참고 문헌 23인용 수 5
한 줄 요약

이 논문은 밀도 기반의 전통적 가우시안 밀도 맵 대신 역 k-가까운 이웃(ikNN) 맵을 도입하여 밀도 있는 군중 수세기 CNN 훈련을 위한 우수한 대안을 제안한다. MUD-ikNN 아키텍처에서 ikNN 레이블링과 전치 합성곱을 사용한 새로운 다중 척도 업샘플링 모듈을 결합함으로써, 여러 기준 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하며, 기존 방법들에 비해 수세기 정확도를 크게 향상시킨다.

ABSTRACT

Gatherings of thousands to millions of people frequently occur for an enormous variety of events, and automated counting of these high-density crowds is useful for safety, management, and measuring significance of an event. In this work, we show that the regularly accepted labeling scheme of crowd density maps for training deep neural networks is less effective than our alternative inverse k-nearest neighbor (i$k$NN) maps, even when used directly in existing state-of-the-art network structures. We also provide a new network architecture MUD-i$k$NN, which uses multi-scale upsampling via transposed convolutions to take full advantage of the provided i$k$NN labeling. This upsampling combined with the i$k$NN maps further improves crowd counting accuracy. Our new network architecture performs favorably in comparison with the state-of-the-art. However, our labeling and upsampling techniques are generally applicable to existing crowd counting architectures.

연구 동기 및 목표

  • 기존의 가우시안 기반 밀도 맵 레이블링 방식이 공간 기울기 정보를 효율적으로 활용하지 못하고, 세밀한 보행자 위치 정보를 유지하지 못하는 한계를 해결하기 위해.
  • 역 k-가까운 이웃(ikNN) 맵이라는 새로운 레이블링 기법을 도입함으로써 더 풍부한 공간 기울기 정보를 제공하면서도 정확한 보행자 위치를 유지함으로써 훈련 효율성과 모델 정확도를 향상시키기 위해.
  • 다중 척도 업샘플링을 전치 합성곱을 통해 구현한 MUD-ikNN이라는 일반화 가능한 네트워크 아키텍처를 설계하여, 여러 특징 수준에서 전체 해상도 감독을 가능하게 하기 위해.
  • 기존 최신 기술 수준의 네트워크에 대해 아키텍처를 대대적으로 수정하지 않고도 ikNN 레이블링과 다중 척도 업샘플링 모듈을 원활하게 통합할 수 있음을 보여주기 위해.
  • 제안된 기법들이 다양한 실제 환경의 군중 데이터셋에서 수세기 성능을 크게 향상시킨다는 것을 검증하기 위해.

제안 방법

  • 논문은 각 픽셀의 값이 k번째로 가까운 이웃까지의 거리에 반비례하는 새로운 레이블링 기법인 역 k-가까운 이웃(ikNN) 맵을 제안한다. 이는 군중 분포에 대한 공간적으로 풍부하고 고기울기 특성을 지닌 표현을 생성한다.
  • ikNN 맵는 가우시안 분포를 가정하지 않으며, 오히려 국소적 밀도 대비를 강조하고, 겹치는 경우조차도 개인 주변의 날카운 경계를 유지한다.
  • MUD-ikNN 네트워크는 밀집 연결된 합성곱 레이어와 전치 합성곱을 사용한 다중 척도 업샘플링 모듈을 통합하여 중간 특징 맵을 전체 진짜값 해상도로 업샘플링함으로써 직접 감독을 가능하게 한다.
  • 업샘플링 모듈은 모든 레이어에서 전체 해상도 감독이 가능하게 하여, 이전 방법에서 사용하던 별도의 중복 브랜치가 필요 없도록 한다.
  • 전치 합성곱 기반 업샘플링은 다양한 스케일로의 유연한 확대를 가능하게 하며, 모델이 전체 해상도의 ikNN 레이블 맵과 직접 특징을 비교할 수 있도록 보장한다.
  • 이 프레임워크는 플러그 앤 플레이 설계를 갖추고 있어, 기존 군중 수세기 네트워크가 최소한의 수정만으로도 ikNN 레이블링과 업샘플링 모듈을 도입하여 성능을 향상시킬 수 있다.

실험 결과

연구 질문

  • RQ1표준 가우시안 밀도 맵을 역 k-가까운 이웃(ikNN) 맵로 대체할 경우, 딥 CNN에서 군중 수세기 정확도가 향상되는가?
  • RQ2전치 합성곱을 통한 다중 척도 업샘플링은 특징 수준의 감독을 향상시키고 군중 수세기 성능을 향상시키는가?
  • RQ3ikNN 레이블링과 다중 척도 업샘플링 모듈은 기존 최신 기술 수준의 군중 수세기 아키텍처에 얼마나 일반화될 수 있는가?
  • RQ4제안된 MUD-ikNN 네트워크는 다양한 실제 환경의 군중 데이터셋에서 현재의 SOTA 방법보다 어떻게 비교되는가?
  • RQ5ikNN 레이블링과 전체 해상도 다중 척도 업샘플링의 조합은 기존 방법에 비해 회귀 오차를 줄이는가?

주요 결과

  • UCF-QNRF 데이터셋에서 MUD-ikNN 모델은 평균 절대 오차(MAE) 104를 기록하여 이전 SOTA 방법(132 MAE, Idrees 등, 2018)을 능가했다.
  • 상하이테크 Part A에서 MUD-ikNN은 MAE 68.0을 달성하여 베이스라인 MUD-densityβ0.3 모델(72.7 MAE)과 이전 SOTA 방법(132 MAE)을 모두 뛰어넘었다.
  • 상하이테크 Part B에서 MUD-ikNN은 MAE 13.4를 기록하여 동일한 설정에서 이전 SOTA(10.6 MAE)를 초월했으며, 다양한 군중 밀도에 걸쳐 강력한 일반화 능력을 입증했다.
  • 제거 실험 결과, 단순히 밀도 맵을 ikNN 맵로 대체하기만 해도 상하이테크 Part A에서 MAE가 72.7에서 70.8로 향상되어, 레이블링 기법 자체의 효과가 아키텍처와 무관하게 입증되었다.
  • 다중 척도 업샘플링 모듈은 모든 레이어에서 전체 해상도 감독을 가능하게 하여, 더 정확한 기울기 흐름과 진짜값과의 특징 정렬을 가능하게 하여 오차를 감소시켰다.
  • 이 방법은 매우 일반화 가능하다. [9]의 네트워크에 적용했을 때, 밀도 맵을 ikNN 맵로 대체함으로써 MAE를 132에서 122로 감소시켜, 레이블링 기법의 광범위한 유용성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.