Skip to main content
QUICK REVIEW

[논문 리뷰] Feature-aware Adaptation and Density Alignment for Crowd Counting in Video Surveillance

Junyu Gao, Yuan Yuan|arXiv (Cornell University)|2019. 12. 08.
Video Surveillance and Tracking Methods참고 문헌 73인용 수 8
한 줄 요약

이 논문은 실세계 감시 환경에 대한 일반화를 향상시키기 위해 합성 데이터를 활용하는 군중 수세기 도메인 적응 프레임워크를 제안한다. 다수의 도메인 간 특징을 정렬하는 다중 수준 특징 인식 적응(MFA)과 출력 밀도 맵을 정교화하는 구조적 밀도 맵 정렬(SDA)을 결합하여, 이전의 비지도 적응 접근 방식에 비해 오차율을 크게 감소시키며 다수의 실세계 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

With the development of deep neural networks, the performance of crowd counting and pixel-wise density estimation are continually being refreshed. Despite this, there are still two challenging problems in this field: 1) current supervised learning needs a large amount of training data, but collecting and annotating them is difficult; 2) existing methods can not generalize well to the unseen domain. A recently released synthetic crowd dataset alleviates these two problems. However, the domain gap between the real-world data and synthetic images decreases the models' performance. To reduce the gap, in this paper, we propose a domain-adaptation-style crowd counting method, which can effectively adapt the model from synthetic data to the specific real-world scenes. It consists of Multi-level Featureaware Adaptation (MFA) and Structured Density map Alignment (SDA). To be specific, MFA boosts the model to extract domain-invariant features from multiple layers. SDA guarantees the network outputs fine density maps with a reasonable distribution on the real domain. Finally, we evaluate the proposed method on four mainstream surveillance crowd datasets, Shanghai Tech Part B, WorldExpo'10, Mall and UCSD. Extensive experiments evidence that our approach outperforms the state-of-the-art methods for the same cross-domain counting problem.

연구 동기 및 목표

  • 감시 응용 분야에서 실세계 레이블이 부족한 군중 데이터 문제를 해결하기 위해.
  • 합성 및 실세계 군중 환경 간의 도메인 갭을 줄여 일반화 능력을 향상시키기 위해.
  • 추가적인 실세계 레이블이 필요 없이 군중 수세기 성능을 향상시키는 도메인 적응 방법을 개발하기 위해.
  • 특징 수준 및 출력 수준의 적응을 통해 미리 보지 못한 실세계 도메인에서 고품질의 구조적 밀도 맵을 생성하기 위해.

제안 방법

  • 합성 및 실세계 군중 이미지 간의 도메인 불변 특징을 추출하기 위해 컨volutional 네트워크(CNN)의 다수의 레이어에 원소별 판별자(element-wise discriminators)를 사용하는 다중 수준 특징 인식 적응(MFA)을 도입한다.
  • 출력 수준에서 도메인 정렬을 촉진하기 위해 구조적 밀도 맵 정렬(SDA)에 맵 판별자(Map Discriminator)를 활용하여 실세계 및 합성 밀도 맵을 구분한다.
  • 타겟 도메인에서의 밀도 예측의 다중 해상도 일관성을 유지하기 위해 자기지도 피라미드 잔여(SPR) 모듈을 통합한다.
  • 거친 밀도 맵을 정제하고 노이즈 및 구조적 아티팩트를 감소시키기 위해 큰 커널 크기([13,9,5,9,13])를 갖는 맵 리파인어(Map Refiner)를 사용한다.
  • 특징 공간과 출력 공간에서의 적대적 훈련을 결합하여 도메인 이동을 동시에 최소화하면서도 공간적 세부 정보를 유지한다.
  • 도메인 적응 모듈을 갖춘 사전 훈련된 SFCN 백본을 활용하여 합성 GCC 데이터셋에서 실세계 데이터셋으로 효과적인 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1다중 수준 특징 적응이 합성 및 실세계 군중 이미지 간의 도메인 이동을 효과적으로 줄일 수 있는가?
  • RQ2실세계 레이블이 없는 조건에서, 미리 보지 못한 실세계 환경에서 밀도 맵 품질을 어떻게 향상시킬 수 있는가?
  • RQ3다양한 해상도에서 밀도 맵의 구조적 정렬이 일반화 능력을 향상시키고 예측 오차를 줄이는 데 기여하는가?
  • RQ4맵 리파인어에서 큰 수신 영역 컨볼루션(convolution)이 예측된 밀도 맵의 정밀도를 크게 향상시킬 수 있는가?

주요 결과

  • 상하이 테크 파트 B에서 제안된 방법은 MAE 144.6과 MSE 200.6을 기록하여 베이스라인 NoAdapt(MAE 156.4, MSE 210.7)와 SE Cycle GAN(MAE 123.4, MSE 193.4)을 모두 초월한다.
  • UCF-QNRF에서 MAE는 NoAdapt의 275.5에서 255.4로 감소하여 다양한 실세계 환경으로의 강력한 일반화 능력을 입증한다.
  • 커널 크기 [13,9,5,9,13]를 갖는 맵 리파인어는 최고의 PSNR(25.62)와 SSIM(0.856)를 기록하여 큰 수신 영역이 노이즈 감소 및 재구성에 유리함을 확인한다.
  • MCNN 및 CSRNet에 SPR를 도입하면 각각 MAE가 6.4%와 4.7% 감소하여 지도 학습 설정에서 개선된 강건성을 보여준다.
  • 시각화 결과는 방법이 군중 밀도 추세와 공간 분포를 효과적으로 포착하지만, 먼 곳이나 저조도 배경 영역에서는 오류가 여전히 존재함을 보여준다.
  • 구조적 및 국소적 특징의 보존이 더 잘 되기 때문에, 실감 나는 감시 도메인에서 GAN 기반 이미지 번역 기법(Single-Image Translation, 예: SE Cycle GAN)보다 더 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.