Skip to main content
QUICK REVIEW

[논문 리뷰] 3D Crowd Counting via Geometric Attention-guided Multi-View Fusion

Qi Zhang, Antoni B. Chan|arXiv (Cornell University)|2020. 03. 18.
Video Surveillance and Tracking Methods참고 문헌 40인용 수 4
한 줄 요약

이 논문은 3D 가우시안 커널 기반의 밀도 맵과 기하학적 주의력 유도 다중 시점 융합을 사용하여 넓고 복잡한 환경에서의 계수 정확도를 향상시키는 3D 다중 시점 군중 수세기 방법을 제안한다. 2D 특징을 3D 공간으로 투영하고 3D 컨볼루션 네트워크(3D CNNs)를 통해 융합함으로써 척도 변화와 가림 현상을 더 잘 다루며, 투영 일관성 손실을 사용한 엔드 투 엔드 학습을 통해 세 개의 다중 시점 데이터셋에서 최신 기술 수준 또는 그 이상의 성능을 달성한다.

ABSTRACT

Recently multi-view crowd counting using deep neural networks has been proposed to enable counting in large and wide scenes using multiple cameras. The current methods project the camera-view features to the average-height plane of the 3D world, and then fuse the projected multi-view features to predict a 2D scene-level density map on the ground (i.e., birds-eye view). Unlike the previous research, we consider the variable height of the people in the 3D world and propose to solve the multi-view crowd counting task through 3D feature fusion with 3D scene-level density maps, instead of the 2D density map on the ground plane. Compared to 2D fusion, the 3D fusion extracts more information of the people along the z-dimension (height), which helps to address the scale variations across multiple views. The 3D density maps still preserve the 2D density maps property that the sum is the count, while also providing 3D information about the crowd density. Furthermore, instead of using the standard method of copying the features along the view ray in the 2D-to-3D projection, we propose an attention module based on a height estimation network, which forces each 2D pixel to be projected to one 3D voxel along the view ray. We also explore the projection consistency among the 3D prediction and the ground truth in the 2D views to further enhance the counting performance. The proposed method is tested on the synthetic and real-world multiview counting datasets and achieves better or comparable counting performance to the state-of-the-art.

연구 동기 및 목표

  • 제한된 시야각과 척도 변화로 인해 넓거나 가로막힘 또는 저해상도 환경에서 단일 시점 군중 수세기의 한계를 해결한다.
  • 기존의 다중 시점 방법에서 2D에서 2D로의 특징 융합 방식이 서로 다른 신체 부위(예: 머리와 발)의 특징를 정렬하지 못하는 점을 보완한다.
  • 3D 공간 정보를 유지하고 수세기의 강인성을 향상시키기 위해 3D 시나리오 수준의 밀도 맵 예측을 위한 엔드 투 엔드 딥 러닝 프레임워크를 개발한다.
  • 3D 예측과 각 카메라 시점의 2D 카메라 뷰 간의 투영 일관성 손실을 도입하여 특징 정렬과 모델 일반화 능력을 향상시킨다.
  • 수평 분포뿐만 아니라 수직 분포까지 포함하는 3D 공간에서의 밀도 모델링을 통해 더 정보가 풍부한 군중 표현을 가능하게 하여, 수세기 이외의 응용 분야를 고려한다.

제안 방법

  • 카메라 파라미터를 사용한 가역적 3D 투영 레이어를 활용하여 다수의 높이 평면에서 2D 이미지 특징을 3D 세계 좌표계로 매핑한다.
  • 3D 가우시안 커널을 사용하여 3D 공간에서의 군중 분포를 표현하는 3D 밀도 맵을 구성하며, 맵의 합은 총 수치와 일치한다.
  • 3D 컨volution 신경망(3D CNNs)을 사용하여 다중 시점 3D 특징을 융합하여 3D 시나리오 수준의 밀도 맵 예측을 생성한다.
  • 일致하고 신뢰할 수 있는 영역을 강조함으로써 기하학적 주의력 메커니즘을 통합하여 특징 융합을 유도한다.
  • 각 카메라 시점에서 3D 예측을 다시 투영한 결과와 2D 진짜값 밀도 맵을 비교하는 투영 일관성 손실(PCM)을 적용한다.
  • 3D 감독, 2D 감독, 그리고 투영 일관성 손실을 조합한 다중 작업 손실을 사용하여 엔드 투 엔드로 모델을 훈련시켜 일반화 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ13D 특징 융합이 수직 공간 관계를 더 잘 모델링하고 척도 변화 문제를 줄여줌으로써 다중 시점 군중 수세기에서 2D 특징 융합보다 우수한 성능을 낼 수 있는가?
  • RQ23D 가우시안 커널 기반의 밀도 맵을 도입함으로써 넓거나 가로막힘 또는 저해상도 환경에서의 군중 수세기 정확도와 강인성이 어떻게 향상되는가?
  • RQ33D 예측과 2D 카메라 뷰 간의 투영 일관성 강제 조건이 모델 성능 향상과 특징 정렬에 어느 정도 기여하는가?
  • RQ4제안된 3D 다중 시점 수세기 프레임워크는 다양한 실제 환경(다양한 가로막힘, 해상도, 카메라 설정)에 일반화되는가?
  • RQ53D 밀도 맵 표현 방식은 수세기 외에도 시나리오 이해, 시각화, 3D 시나리오 재구성에 기여할 수 있는가?

주요 결과

  • PETS2009 데이터셋에서 제안된 방법은 기준 모델들과 MVMS 모델을 모두 능가하여 비교된 모든 방법 중 최고 성능을 기록했다.
  • DukeMTMC에서 제안된 방법은 MVMS와 유사한 성능을 기록했으며, 특히 낮은 군중 밀도와 최소한의 가로막힘 특성을 지닌 데이터셋에서 두 기준 모델보다 뚜렷한 우위를 보였다.
  • CityStreet에서 제안된 방법은 모든 엔드 투 엔드 다중 시점 방법 중에서 최고 성능을 기록했으며, 높은 군중 수와 심각한 가로막힘에 대비해 뛰어난 강인성을 보였다.
  • 절단 실험 결과, 3D 손실, 2D 감독, 투영 일관성 손실(3D+2D+PCM)을 모두 조합할 경우 모든 데이터셋에서 최고의 성능을 기록했으며, 최적의 초모수는 데이터셋에 따라 달라졌다.
  • 최적의 3D 바vox 높이와 높이 평면 수는 데이터셋에 따라 달라졌다: PETS2009는 40cm와 7개의 바vox, DukeMTMC는 10cm와 36개의 바vox, CityStreet는 10cm와 28개의 바vox로, 각각 다른 가로막힘 및 해상도 특성을 반영했다.
  • 3D 가우시안 커널 표현 방식은 군중 분포의 생생한 3D 시각화를 가능하게 하고, 임의의 시점 각도에서의 시나리오 재구성을 지원하여 더 넓은 응용 분야 잠재력을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.