Skip to main content
QUICK REVIEW

[논문 리뷰] Joint CNN and Transformer Network via weakly supervised Learning for efficient crowd counting

Fusen Wang, Kai Liu|arXiv (Cornell University)|2022. 03. 12.
Video Surveillance and Tracking Methods인용 수 10
한 줄 요약

이 논문은 오직 카운트 수준의 레이블만을 사용하는 약한 감독 기반의 커뮤니티 카운팅을 위한 JCTNet을 제안한다. 이는 위치 수준의 레이블링에 비해 비용이 많이 드는 것을 방지한다. 지역적 의미 특징 추출을 위해 CNN을, 전역적 맥락 모델링을 위해 수정된 Swin Transformer를 조합함으로써, 순수한 Transformer 모델 대비 67–73% 적은 파라미터로 최신 기술 수준의 성능을 달성하면서도, 약한 감독 조건에서도 군중 영역에 효과적으로 집중할 수 있다.

ABSTRACT

Currently, for crowd counting, the fully supervised methods via density map estimation are the mainstream research directions. However, such methods need location-level annotation of persons in an image, which is time-consuming and laborious. Therefore, the weakly supervised method just relying upon the count-level annotation is urgently needed. Since CNN is not suitable for modeling the global context and the interactions between image patches, crowd counting with weakly supervised learning via CNN generally can not show good performance. The weakly supervised model via Transformer was sequentially proposed to model the global context and learn contrast features. However, the transformer directly partitions the crowd images into a series of tokens, which may not be a good choice due to each pedestrian being an independent individual, and the parameter number of the network is very large. Hence, we propose a Joint CNN and Transformer Network (JCTNet) via weakly supervised learning for crowd counting in this paper. JCTNet consists of three parts: CNN feature extraction module (CFM), Transformer feature extraction module (TFM), and counting regression module (CRM). In particular, the CFM extracts crowd semantic information features, then sends their patch partitions to TRM for modeling global context, and CRM is used to predict the number of people. Extensive experiments and visualizations demonstrate that JCTNet can effectively focus on the crowd regions and obtain superior weakly supervised counting performance on five mainstream datasets. The number of parameters of the model can be reduced by about 67%~73% compared with the pure Transformer works. We also tried to explain the phenomenon that a model constrained only by count-level annotations can still focus on the crowd regions. We believe our work can promote further research in this field.

연구 동기 및 목표

  • 각 개인의 위치 수준의 바운딩 박스가 필요로 하는 완전한 감독 기반의 커뮤니티 카운팅 방법의 높은 레이블링 비용을 해결하기 위해.
  • CNN이 군중 장면에서 장거리 의존성과 전역 맥락을 모델링하는 데 한계를 가지는 문제를 해결하기 위해.
  • 순수한 Transformer 모델의 단점인 과도한 파라미터 수와 개인을 토큰 간에 나누는 비합리적인 패치 분할 방식을 완화하기 위해.
  • 이미지 수준의 카운트 레이블만을 사용하여도 높은 정확도를 달성하는 약한 감독 기반의 커뮤니티 카운팅 프레임워크를 개발하기 위해.
  • 오직 카운트 수준의 감독만으로 훈련된 모델가 여전히 군중 영역에 주의를 기울일 수 있는 이유를, 상호 보완적인 CNN과 Transformer 학습 방식을 통해 설명하기 위해.

제안 방법

  • JCTNet는 입력 이미지에서 국소적 의미 특징을 추출하기 위해 VGG16-BN의 첫 10개 레이어를 기반으로 한 CNN 특징 추출 모듈(CFM)을 통합한다.
  • CFM에서 생성된 특징 맵은 패치로 분할되어 수정된 Swin Transformer 블록(MSTB)에 입력되어 전역 맥락 모델링과 장거리 의존성 학습을 수행한다.
  • Transformer 모듈은 국소 자기주의 및 창 간 상호작용을 사용하여 공간적 관계를 유지하고 특징 표현을 향상시킨다.
  • 최종 토큰 특징을 처리하기 위해 카운팅 회귀 모듈(CRM)이 사용되어 이미지 내 총 인원 수를 예측한다.
  • 모델는 카운트 수준의 감독에서 예측 오차를 최소화하기 위해 스무스 L1 손실 함수를 사용하여 엔드 투 엔드로 훈련된다.
  • 모델 아키텍처는 CNN의 인덕티브 바이어스를 활용하여 파라미터 수를 줄이면서도, Transformer의 전역 모델링 능력을 유지하도록 설계되었다.

실험 결과

연구 질문

  • RQ1오직 이미지 수준의 카운트만으로 훈련된 약한 감독 기반의 커뮤니티 카운팅 모델도 실제로 군중 영역에 주의를 기울일 수 있는가?
  • RQ2CNN과 Transformer를 함께 최적화하여 성능을 향상시키면서도 모델 복잡도를 줄일 수 있는가?
  • RQ3Transformer의 자기주의 메커니즘이 CNN만으로는 불가능한 군중 영역과 배경 영역 간의 구분을 향상시킬 수 있는가?
  • RQ4제안된 아키텍처에서 임bedding 차원과 Swin Transformer 블록 수 사이의 최적의 트레이드오프는 무엇인가?
  • RQ5위치 수준의 감독이 없음에도 불구하고 모델이 잘 일반화되는 이유는 무엇인가?

주요 결과

  • JCTNet는 상하이테크 Part A 데이터셋에서 평균 절대 오차(MAE) 62.8을 기록하여 이전의 약한 감독 기반 방법들을 능가한다.
  • 순수한 Transformer 기반 접근 방식 대비 67–73%의 파라미터 수를 감소시켰으며, 최적 설정에서 28.8M의 파라미터를 가진다.
  • 제거 실험을 통해 CFM, TFM, CRM 각각의 구성 요소가 성능 향상에 점진적으로 기여하는 것으로 확인되었다.
  • L1 손실 대신 스무스 L1 손실을 사용할 경우, 상하이테크 Part A에서 MAE는 63.7에서 62.8로 감소하고, MSE는 98.1에서 95.6으로 감소한다.
  • 시각화 결과는 위치 수준의 감독 없이도 모델이 군중 영역(빨간 사각형)에 집중하고 있음을 보여주며, 효과적인 주의 훈련이 이루어졌음을 시사한다.
  • CNN의 인덕티브 바이어스와 Transformer의 전역 모델링 능력의 조합은 전경과 배경 간의 대비 특징을 학습할 수 있게 하여, 약한 감독 조건에서도 강건한 성능을 달성하는 이유를 설명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.