Skip to main content
QUICK REVIEW

[논문 리뷰] Domain-adaptive Crowd Counting via High-quality Image Translation and Density Reconstruction

Junyu Gao, Tao Han|arXiv (Cornell University)|2019. 12. 08.
Video Surveillance and Tracking Methods참고 문헌 63인용 수 7
한 줄 요약

이 논문은 도메인 적응형 군중 수세기(DACC)를 제안하며, 합성 군중 이미지를 실제 이미지로 변환하기 위해 도메인 간 특징 분離와 콘텐츠 인식 손실을 사용하고, 이후 가우시안 사전을 통한 가짜 밀도 맵 재구성으로 최종 수세기 모델을 재학습시켜 실제 데이터에서의 군중 수세기 성능을 햖थ한다. DACC는 기존 도메인 적응 방법에 비해 MAE와 MSE를 크게 감소시켜 여섯 개인 실제 데이터셋에서 최고 성능을 달성한다.

ABSTRACT

Recently, crowd counting using supervised learning achieves a remarkable improvement. Nevertheless, most counters rely on a large amount of manually labeled data. With the release of synthetic crowd data, a potential alternative is transferring knowledge from them to real data without any manual label. However, there is no method to effectively suppress domain gaps and output elaborate density maps during the transferring. To remedy the above problems, this paper proposes a Domain-Adaptive Crowd Counting (DACC) framework, which consists of a high-quality image translation and density map reconstruction. To be specific, the former focuses on translating synthetic data to realistic images, which prompts the translation quality by segregating domain-shared/independent features and designing content-aware consistency loss. The latter aims at generating pseudo labels on real scenes to improve the prediction quality. Next, we retrain a final counter using these pseudo labels. Adaptation experiments on six real-world datasets demonstrate that the proposed method outperforms the state-of-the-art methods.

연구 동기 및 목표

  • 합성과 실제 군중 장면 간의 도메인 갭을 해결함으로써 군중 수세기에서 효과적인 전이 학습을 가능하게 하기 위해.
  • 도메인 공유 및 도메인 독립적 특징을 분리함으로써, 조밀한 군중에 중요한 무늬와 텍스처를 유지하는 이미지 변환 품질을 향상시키기 위해.
  • 가우시안 커널 사전을 활용해 실제 장면에 대한 정확한 가짜 밀도 맵을 생성함으로써 최종 군중 수세기 모델의 효과적인 재학습을 가능하게 하기 위해.
  • 실제 데이터에 대한 수동 애너테이션 없이 도메인 적응형 군중 수세기에서 최고 성능을 달성하기 위해.

제안 방법

  • 도메인 간 특징 분리(IFS)를 제안하며, 도메인 공유 특징(예: 사람의 구조, 군중 패턴)을 먼저 추출하고, 도메인 독립적 특징(예: 배경, 센서 효과)과 조합하여 목표 도메인 유사 이미지를 재구성하는 두 단계 체인 아키텍처를 사용한다.
  • 이미지 변환 중 국소 구조와 텍스처를 유지하기 위해 다중 척도 적대적 변환 손실과 콘텐츠 인식 일致성 손실을 도입하여 기존 CycleGAN 손실에 비해 왜곡을 줄인다.
  • 변환된 합성 이미지로 훈련된 코arse 수세기 모델을 활용해 실제 장면에서 초기 밀도 맵을 생성한다.
  • 가우시안 사전 재구성(GPR)을 적용하여 코arse 예측과 표준 가우시안 커널을 매칭시켜 고품질의 가짜 밀도 맵을 생성하며, 머리의 알려진 공간 분포를 활용한다.
  • 실제 이미지와 재구성된 가짜 밀도 맵을 사용해 최종 군중 수세기 모델을 재학습시켜 실제 데이터에서의 예측 정확도를 크게 향상시킨다.
  • 밀도 맵 품질을 향상시키고 오차를 줄이는 데 기여하는 재학습 기반 설계를 사용하며, 특히 복잡하거나 혼잡한 장면에서 효과적이다.

실험 결과

연구 질문

  • RQ1도메인 공유 및 도메인 독립적 특징을 분리하면 합성에서 실제 이미지로의 변환 품질이 군중 수세기에서 향상되는가?
  • RQ2콘텐츠 인식 및 다중 척도 적대적 손실은 변환된 군중 이미지의 텍스처와 구조적 왜곡을 줄이는가?
  • RQ3가우시안 사전을 기반으로 한 가짜 밀도 맵 재구성은 실제 데이터에서 군중 수세기 성능을 향상시키는가?
  • RQ4제안된 DACC 프레임워크는 합성에서 실제 데이터로의 제로샷 군중 수세기에서 기존 도메인 적응 방법을 초월하는가?

주요 결과

  • DACC는 여섯 개인 실제 군중 수세기 데이터셋에서 최고 성능을 달성하며, 기존 도메인 적응 방법에 비해 뚜렷이 뛰어난 성능을 보였다.
  • 상하이 테크 파트 A 데이터셋에서, DACC는 도메인 적응 없이 MAE 206.7에서 112.4로, MSE 297.1에서 176.9로 감소시켜 감독 학습 성능(MAE 69.6, MSE 125.9)에 가까워졌다.
  • 제안된 IFS 모듈은 도메인 공유 특징을 효과적으로 추출하며, 교환 실험에서 일관된 특징 시각화 결과를 보여 주어 강건성과 일반화 능력을 확인했다.
  • 가우시안 사전 기반의 가짜 레이블 재구성은 밀도 맵 품질을 크게 향상시켰으며, 실제값과의 유사도가 높은 시각적 비교 결과로 그 효과를 입증했다.
  • 품질 높은 결과는 배경 객체에 대한 잘못된 예측을 줄였으며, 정성적 결과에서 DACC가 비군중 영역을 과도하게 예측하지 않는 것을 확인할 수 있었다.
  • 제거 실험 결과, IFS와 GPR 모듈 모두 필수적임을 확인하였으며, 둘 중 하나를 제거하면 성능이 떨어졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.