Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-View Cross-Scene Multi-View Crowd Counting

Qi Zhang, Wei Lin|arXiv (Cornell University)|2022. 05. 03.
Video Surveillance and Tracking Methods인용 수 8
한 줄 요약

이 논문은 기하학적 주의력 메커니즘을 사용하여 동적 뷰 융합과 노이즈 뷰 정규화를 통해 다양한 장면과 카메라 레이아웃 간 일반화를 위한 새로운 크로스뷰 크로스シーン(CVCS) 다중뷰 군중 수세기 프레임워크를 제안한다. 대규모 합성 다중카메라 데이터셋으로 훈련된 CVCS 모델은 비지도 도메인 적응을 통해 실세계 데이터셋에서 최신 기술 수준의 성능을 달성하며, 동일한 장면에서 훈련된 완전 지도 학습 방법을 능가한다.

ABSTRACT

Multi-view crowd counting has been previously proposed to utilize multi-cameras to extend the field-of-view of a single camera, capturing more people in the scene, and improve counting performance for occluded people or those in low resolution. However, the current multi-view paradigm trains and tests on the same single scene and camera-views, which limits its practical application. In this paper, we propose a cross-view cross-scene (CVCS) multi-view crowd counting paradigm, where the training and testing occur on different scenes with arbitrary camera layouts. To dynamically handle the challenge of optimal view fusion under scene and camera layout change and non-correspondence noise due to camera calibration errors or erroneous features, we propose a CVCS model that attentively selects and fuses multiple views together using camera layout geometry, and a noise view regularization method to train the model to handle non-correspondence errors. We also generate a large synthetic multi-camera crowd counting dataset with a large number of scenes and camera views to capture many possible variations, which avoids the difficulty of collecting and annotating such a large real dataset. We then test our trained CVCS model on real multi-view counting datasets, by using unsupervised domain transfer. The proposed CVCS model trained on synthetic data outperforms the same model trained only on real data, and achieves promising performance compared to fully supervised methods that train and test on the same single scene.

연구 동기 및 목표

  • 기존의 다중뷰 군중 수세기 모델이 단일 장면와 고정된 카메라 레이아웃 내에서만 일반화된다는 한계를 해결하기 위해.
  • 다양한 장면과 임의의 카메라 레이아웃 간에 다중뷰 군중 수세기에서 효과적인 일반화를 가능하게 하기 위해.
  • 다양한 기하학적 구성 조건에서 여러 카메라의 특징을 동적으로 선택하고 융합할 수 있는 강건한 모델을 개발하기 위해.
  • 카메라 캘리브레이션 정확도 부족이나 특징 이격으로 인한 비대응 오류를 노이즈 주입 정규화 전략을 통해 완화하기 위해.
  • 다양한 장면과 뷰 조합에서 훈련이 가능한 대규모 합성 다중카메라 군중 수세기 데이터셋을 구축하기 위해.

제안 방법

  • 모델은 각 카메라에서의 단일 뷰 특징을 추출하기 위해 VGG-Net 백본을 사용한다.
  • 카메라 레이아웃 기하학에 기반한 카메라 투영 행렬을 사용하여 특징을 평균 높이 평면에 투영한다.
  • 객체-카메라 거리에 따라 관련 뷰를 주의력 메커니즘이 선택하여 다중뷰 특징의 동적 융합을 가능하게 한다.
  • 선택된 특징들이 최대 풀링 레이어를 통해 통합 표현으로 융합되어 장면 수준의 밀도 예측을 위한 것으로 사용된다.
  • 훈련 중에 오류가 있는 특징을 주입하여 노이즈 뷰 정규화를 적용함으로써 비대응 오류에 대한 강건성을 향상시킨다.
  • 군중 레이블이 필요 없이 실세계 테스트 이미지에 대해 비지도 도메인 적응을 통해 합성 훈련 모델을 미세조정한다.

실험 결과

연구 질문

  • RQ1다양한 장면과 임의의 카메라 레이아웃 간에 다중뷰 군중 수세기 모델이 효과적으로 일반화될 수 있는가?
  • RQ2다양한 카메라 구성과 장면 기하학 조건에서 모델이 어떻게 여러 카메라의 특징을 동적으로 선택하고 융합할 수 있는가?
  • RQ3비대응 오류는 다중뷰 수세기 성능에 어떤 영향을 미치며, 훈련 중에 이를 어떻게 완화할 수 있는가?
  • RQ4대규모 합성 데이터셋이 실세계 교차 장면 다중뷰 군중 수세기 모델 훈련에 효과적으로 기여할 수 있는가?
  • RQ5비지도 도메인 적응이 합성 훈련 모델을 실세계 테스트 장면으로 이식할 때 성능을 크게 향상시키는가?

주요 결과

  • 합성 데이터로 훈련된 CVCS 모델가 실데이터로만 훈련된 모델보다 성능이 뛰어나, 합성 데이터의 교차 장면 일반화 효과를 입증한다.
  • 비지도 도메인 적응을 통해 미세조정된 CVCS 모델은 실세계 테스트 데이터에서 평균 절대 오차(MAE) 5.17을 기록하며, 기준 모델보다 뛰어난 성능을 보였다.
  • 동일한 모델에서 도메인 적응을 적용한 경우, 적용하지 않은 경우에 비해 오차가 1.5–2.0 MAE 감소하여 도메인 갭 완화가 효과적임을 시사한다.
  • 카메라 선택 및 노이즈 뷰 정규화를 적용한 모델이 백본 또는 MVMS 기준 모델보다 낮은 오차를 기록하여 제안된 모듈의 유효성을 입증한다.
  • 실제 장면 두 곳(RealC)으로만 훈련할 경우 높은 오차가 발생하지만, 다양한 장면과 뷰 조합을 포함한 합성 데이터로 훈련할 경우 훨씬 우수한 일반화 성능을 얻는다.
  • 완전 지도 학습 모델이 동일한 장면에서 훈련된 것과 비교해도 경쟁 가능한 성능을 기록함으로써, CVCS 모델이 실세계 구현에 실용적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.