Skip to main content
QUICK REVIEW

[논문 리뷰] CrowdFormer: Weakly-supervised Crowd counting with Improved Generalizability

Siddharth Singh Savner, Vivek Kanhangad|arXiv (Cornell University)|2022. 03. 07.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

CrowdFormer는 다중 척도 및 전역적 문맥 특징을 캡처하기 위해 피라미드 비전 트랜스포머(PVTv2) 백본을 사용하는 약한 감독 기반 군중 수세기 방법을 제안한다. 여기에는 학습 가능한 특징 집합 모듈과 간단한 회귀 헤드가 포함되어 있으며, 기준 데이터셋에서 최고 성능을 기록하고, 교차 데이터셋 평가에서 뛰어난 일반화 성능을 보이며, 많은 완전 감독 방법을 능가한다.

ABSTRACT

Convolutional neural networks (CNNs) have dominated the field of computer vision for nearly a decade due to their strong ability to learn local features. However, due to their limited receptive field, CNNs fail to model the global context. On the other hand, transformer, an attention-based architecture can model the global context easily. Despite this, there are limited studies that investigate the effectiveness of transformers in crowd counting. In addition, the majority of the existing crowd counting methods are based on the regression of density maps which requires point-level annotation of each person present in the scene. This annotation task is laborious and also error-prone. This has led to increased focus on weakly-supervised crowd counting methods which require only the count-level annotations. In this paper, we propose a weakly-supervised method for crowd counting using a pyramid vision transformer. We have conducted extensive evaluations to validate the effectiveness of the proposed method. Our method is comparable to the state-of-the-art on the benchmark crowd datasets. More importantly, it shows remarkable generalizability.

연구 동기 및 목표

  • 군중 수세기에서 점 수준의 밀도 맵 감독에 필요한 높은 애너테이션 비용 문제를 해결하기 위해 오직 카운트 수준의 애너테이션만을 사용하는 약한 감독 학습을 가능하게 하기 위해.
  • 비전 트랜스포머를 통해 전역적 문맥 모델링을 활용하여 CNN의 제한된 수신장과 비교해 성능을 향상시키기 위해.
  • 트랜스포머 기반 아키텍처에서 다중 척도 특징 집합 메커니즘을 설계하여 다양한 군중 환경에서의 모델 일반화 성능을 향상시키기 위해.
  • 특히 교차 데이터셋 평가 설정에서 최신 완전 감독 방법과 비교해 경쟁적 또는 우수한 성능을 달성하기 위해.

제안 방법

  • 입력 이미지에서 다중 척도 특징과 전역적 문맥을 추출하기 위해 사전 학습된 PVTv2 백본을 사용한다.
  • 피라미드 비전 트랜스포머의 네 단계에서 유도된 특징을 융합하기 위한 학습 가능한 특징 집합 모듈을 도입한다.
  • 집합된 특징을 직접 최종 군중 수에 매핑하기 위해 단순한 회귀 헤드를 사용하여, 밀도 맵 합산 과정을 회피한다.
  • 엔드 투 엔드 학습을 위해 시퀀스에서 카운트로의 매핑을 적용하여 2차원 밀도 맵 감독이 필요 없도록 한다.
  • 트랜스포머의 자기주의 메커니즘을 활용해 이미지 전역의 장거리 공간적 종속성을 모델링한다.
  • 점 수준의 애너테이션에 의존도를 최소화하기 위해 오직 이미지 수준의 카운트 애너테이션만을 사용하여 모델을 학습한다.
Fig. 1 : The pipeline of the proposed CrowdFormer
Fig. 1 : The pipeline of the proposed CrowdFormer

실험 결과

연구 질문

  • RQ1비전 트랜스포머 기반 아키텍처가 오직 카운트 수준의 애너테이션만을 사용하는 약한 감독 기반 군중 수세기에서 최고 성능을 달성할 수 있는가?
  • RQ2피라미드 비전 트랜스포머를 통한 다중 척도 특징 추출이 단일 척도 또는 CNN 기반 방법에 비해 다양한 군중 환경에서의 일반화 성능을 향상시키는가?
  • RQ3제안된 특징 집합 전략은 교차 데이터셋 평가에서 기존 방법과 비교해 성능 및 강건성 측면에서 어떻게 비교되는가?
  • RQ4약한 감독 기반 트랜스포머 모델이 교차 데이터셋 설정에서 완전 감독 모델을 능가할 수 있는가?

주요 결과

  • SHA 데이터셋에서 CrowdFormer은 이전 최고의 약한 감독 방법 대비 MAE를 3.6% 향상시키고, MSE를 0.63% 향상시켜 최고 성능을 기록했다.
  • UCF_CC_50 데이터셋에서 CrowdFormer은 약한 감독 방법 중에서 가장 낮은 MAE를 기록했으며, CCTrans에 비해 6.3% 높은 성능을 보였다.
  • 교차 데이터셋 평가에서 CrowdFormer은 최고 성능을 기록했으며, 특히 SHA나 QNRF와 같은 도전적인 데이터셋에서 학습한 경우, 몇몇 완전 감독 방법조차 능가했다.
  • 모델는 강력한 일반화 성능을 보였으며, 고밀도 또는 복잡한 환경에서 학습한 후 단순한 데이터셋으로 효과적으로 전이되는 경향을 보였다.
  • 단일 척도 특징만을 사용하는 TransCrowd에 비해 CrowdFormer이 뛰어난 성능을 보여, 트랜스포머 기반 아키텍처에서의 다중 척도 특징 융합의 유용성을 입증했다.
  • 극단적인 시각 왜곡(예: UCF_CC_50)을 포함한 다양한 데이터셋에서도 성능이 강건하여, 실세계 적용 가능성에 대한 확인을 제공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.