Skip to main content
QUICK REVIEW

[논문 리뷰] CrowdCLIP: Unsupervised Crowd Counting via Vision-Language Model

Dingkang Liang, Jiahao Xie|arXiv (Cornell University)|2023. 04. 09.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

CrowdCLIP는 크기 순으로 정렬된 군중 패치에 대해 다중 모odal 순서 매기기 손실을 사용하여 이미지 인코더를 미세 조정하고 추론 중에 점진적 필터링 전략을 적용함으로써 대조적 사전 훈련된 시각-언어 모델(CLIP)을 활용하는 비지도 군중 수세기 프레임워크를 제안한다. 이는 UCF-QNRF에서 이전의 비지도 SOTA 방법보다 MAE 기준 35.2% 향상되며, 교차 데이터셋 설정에서 일부 완전히 지도 학습된 모델을 초월하는 최고 성능을 달성한다.

ABSTRACT

Supervised crowd counting relies heavily on costly manual labeling, which is difficult and expensive, especially in dense scenes. To alleviate the problem, we propose a novel unsupervised framework for crowd counting, named CrowdCLIP. The core idea is built on two observations: 1) the recent contrastive pre-trained vision-language model (CLIP) has presented impressive performance on various downstream tasks; 2) there is a natural mapping between crowd patches and count text. To the best of our knowledge, CrowdCLIP is the first to investigate the vision language knowledge to solve the counting problem. Specifically, in the training stage, we exploit the multi-modal ranking loss by constructing ranking text prompts to match the size-sorted crowd patches to guide the image encoder learning. In the testing stage, to deal with the diversity of image patches, we propose a simple yet effective progressive filtering strategy to first select the highly potential crowd patches and then map them into the language space with various counting intervals. Extensive experiments on five challenging datasets demonstrate that the proposed CrowdCLIP achieves superior performance compared to previous unsupervised state-of-the-art counting methods. Notably, CrowdCLIP even surpasses some popular fully-supervised methods under the cross-dataset setting. The source code will be available at https://github.com/dk-liang/CrowdCLIP.

연구 동기 및 목표

  • 점수 수준의 애너테이션을 필요로 하는 기존 지도 학습 기반 군중 수세기 방법의 높은 애너테이션 비용 문제를 해결한다.
  • 기존의 약한 지도 및 반지도 학습 방법의 한계를 극복하기 위해 인간이 제공한 모든 애너테이션을 제거한다.
  • CLIP와 같은 시각-언어 사전 훈련 모델이 계수 수준 또는 점 수준의 레이블 없이도 비지도 군중 수세기 임무에 어떻게 활용될 수 있는지 탐색한다.
  • 미세 조정과 구조화된 추론을 통해 원래의 CLIP 모델의 제로샷 성능을 향상시켜 군중 수세기 작업에 적합하게 한다.
  • 레이블 데이터에 의존하지 않고 다양한 군중 환경에서 잘 일반화되는 강력하고 확장 가능한 방법을 개발한다.

제안 방법

  • 크기 순으로 정렬된 군중 패치를 기술하는 순서 매기기 텍스트 프롬프트(예: '20', '55', '90', '125', '160', '195')를 구성하여 이미지 인코더의 미세 조정을 위한 다중 모달 순서 매기기 손실을 형성한다.
  • 순서 매기기 손실을 사용하여 CLIP의 이미지 인코더만 미세 조정하여 군중 의미와 밀도 패턴을 더 잘 이해하도록 한다.
  • 추론 중에 세 단계의 점진적 필터링 전략을 적용한다: (1) 거친 분류를 통해 후보 패치 선별, (2) 정밀 분류를 통해 선별 강화, (3) 텍스트 임베딩 유사도를 통한 계수 간격 매핑.
  • 추론 중 텍스트 인코더를 고정하여 사전 훈련된 언어 사전 지식을 유지하고 이미지 특징와 계수 기술 간의 안정적인 정렬을 확보한다.
  • CLIP 이미지 인코더를 사용해 패치를 임bedding하고, 계수 간격의 텍스트 임베딩과 코사인 유사도를 계산하여 최종 계수를 예측한다.
  • 패치 수와 프롬프트 구성 방식을 성능과 강건성 간의 균형을 맞추기 위해 설계하였으며, 이미지당 4~5개 패치에서 최적 성능를 기록한다.

실험 결과

연구 질문

  • RQ1CLIP와 같은 시각-언어 사전 훈련 모델이 인간이 제공한 데이터 없이도 비지도 군중 수세기 작업에 효과적으로 적용될 수 있는가?
  • RQ2제로샷 CLIP가 군중 수세기 작업에서 실패하는 이유는 무엇이며, 직접 적용할 경우 주요 제약 조건은 무엇인가?
  • RQ3다중 모달 순서 매기기 손실은 이미지 인코더가 다양한 밀도의 군중 패치를 구분하는 능력을 어떻게 향상시키는가?
  • RQ4추론 중 점진적 필터링 전략은 눈에 띄는 머리가 없는 등 모호한 패치의 영향을 줄이고 최종 계수 정확도를 향상시키는가?
  • RQ5텍스트 인코더를 고정한 채 이미지 인코더만 미세 조정하면 원래의 CLIP 모델보다 더 높은 성능을 달성할 수 있는가?

주요 결과

  • CrowdCLIP는 UCF-QNRF 데이터셋에서 이전의 비지도 SOTA 방법인 CSS-CCNN보다 MAE 기준 35.2% 향상되었으며, MAE는 283.3으로 측정되었고, CSS-CCNN의 441.0보다 낮다.
  • 교차 데이터셋 평가에서 CrowdCLIP는 CSRNet과 SANet과 같은 일부 완전히 지도 학습된 최고 성능 모델을 뛰어넘었으며, 레이블 데이터 없이도 강력한 일반화 성능을 보였다.
  • 텍스트 인코더를 고정하고 이미지 인코더만 미세 조정할 경우 최고의 성능(MAE = 283.3)을 기록했으며, 텍스트 인코더까지 미세 조정할 경우 정확도가 크게 떨어졌다.
  • 추론에 가장 적합한 패치 수는 4개 또는 5개이며, 각각 MAE가 283.3과 305.2로 측정되었고, 제로샷 CLIP(MAE = 414.7)와 3개 패치 기반 베이스라인을 모두 뛰어넘었다.
  • 더 많은 훈련 데이터를 사용할수록 성능이 점진적으로 향상되었으며, 상하이테크 파트 A와 같은 추가 데이터를 활용할 경우 정확도가 더욱 향상되어 비지도 접근의 확장 가능성을 입증했다.
  • 이 방법은 다양한 데이터셋에 대해 잘 일반화되며, UCF-QNRF, 상하이테크, NWPU-Crowd를 포함한 다섯 개의 도전적인 벤치마크에서 일관된 성능 향상을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.