Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcing Local Feature Representation for Weakly-Supervised Dense Crowd Counting

Xiaohong Chen, Hongtao Lu|arXiv (Cornell University)|2022. 02. 22.
Video Surveillance and Tracking Methods인용 수 4
한 줄 요약

이 논문은 전역 인원 수만 제공되는 약한 감독 아래에서 국소적 특징 표현을 향상시키기 위해 자기적응형 특징 유사도 학습(SFSL) 네트워크와 글로벌-로컬 일致성(GLC) 손실을 제안한다. 비편향된 특징 추정과 글로벌 및 로컬 예측 간 일치를 학습함으로써, 상당히 감소된 주석 작업으로 완전 감독 방법에 가까운 성능을 달성한다.

ABSTRACT

Fully-supervised crowd counting is a laborious task due to the large amounts of annotations. Few works focus on weekly-supervised crowd counting, where only the global crowd numbers are available for training. The main challenge of weekly-supervised crowd counting is the lack of local supervision information. To address this problem, we propose a self-adaptive feature similarity learning (SFSL) network and a global-local consistency (GLC) loss to reinforce local feature representation. We introduce a feature vector which represents the unbiased feature estimation of persons. The network updates the feature vector self-adaptively and utilizes the feature similarity for the regression of crowd numbers. Besides, the proposed GLC loss leverages the consistency between the network estimations from global and local areas. The experimental results demonstrate that our proposed method based on different backbones narrows the gap between weakly-supervised and fully-supervised dense crowd counting.

연구 동기 및 목표

  • 전역 인원 수만 제공되는 약한 감독 아래에서 국소적 감독의 제한 문제를 해결한다.
  • 개체 수준 주석이 없는 상황에서도 국소적 특징의 구별 능력을 향상시킨다.
  • 전역 인원 수와 자기주도적 국소 감독을 활용해 고비용 수동 주석에 대한 의존도를 줄인다.
  • 인간 감지 기반 주석 방식에서 흔히 발생하는 레이블 편차에 대한 모델의 강건성을 향상시킨다.
  • 약한 감독과 완전 감독 기반 인원 수 계산 방법 간의 성능 격차를 좁힌다.

제안 방법

  • 양성 클래스(사람)에 대한 클러스터 중심으로 비편향된 특징 추정 벡터를 유지하는 자기적응형 특징 유사도 학습(SFSL) 네트워크를 도입한다.
  • 학습 중 경사 하강법을 통해 특징 추정 벡터를 갱신하여 사람 특징 표현을 적응적으로 개선한다.
  • 학습된 특징 벡터와 기반 네트워크 특징 간 픽셀 단위 특징 유사도를 계산하여 밀도 추정을 위한 소프트 이진 분류 맵을 생성한다.
  • 이 유사도 맵을 선형 회귀 헤드의 입력으로 사용하여 최종 인원 수를 예측한다.
  • 글로벌 예측과 하위 영역에서의 로컬 예측 간 일치를 강제하는 글로벌-로컬 일치성(GLC) 손실을 제안한다.
  • 전역 예측을 감독 신호로 사용하여 로컬 회귀를 자기주도적으로 학습함으로써, 최소한의 주석으로도 국소적 특징 학습을 향상시킨다.

실험 결과

연구 질문

  • RQ1개체 수준 주석이 없는 약한 감독 기반 인원 수 계산에서 국소적 특징 표현을 효과적으로 강화할 수 있는가?
  • RQ2어떻게 전역 인원 수를 활용하여 국소 영역 예측을 감독하고 특징의 구별 능력을 향상시킬 수 있는가?
  • RQ3자동화된 주석 방식에서 흔히 발생하는 레이블 편차 상황에서도 모델이 얼마나 정확도를 유지할 수 있는가?
  • RQ4성능 및 주석 효율성 측면에서 제안된 방법은 완전 감독 기반 기준과 어떻게 비교되는가?
  • RQ5다양한 인원 밀도, 시점, 객체 크기 조건에서 다양한 백본을 사용해도 일반화가 가능한가?

주요 결과

  • 제안된 방법은 네 개의 인원 수 계산 데이터셋에서 경쟁적인 성능을 달성하며, 약한 감독과 완전 감독 기반 방법 간 격차를 크게 좁혔다.
  • CNN 백본을 사용할 경우 상하이테크 Part A 데이터셋에서 평균 절대 오차(MAE)가 12.8을 기록하여 완전 감독 기반 기준에 근접한다.
  • 레이블 노이즈에 대해 강건한 성능을 보이며, 정규 분포 노이즈의 표준편차가 σ=0.1에 도달할 때도 MAE는 3.5% 증가하고 MSE는 0.9% 증가할 뿐이다.
  • 패치 단위 주석(6배 더 많은 주석)을 사용해 훈련할 경우 성능이 크게 향상되어, 더 많은 전역 주석이 제공될 경우 추가적인 성능 향상 잠재력이 높다는 것을 시사한다.
  • 다양한 백본(기존 CNN 및 비전 트랜스포머(ViT))에 대해 일반화 가능성을 보이며 광범위한 적용 가능성을 입증한다.
  • GLC 손실은 명시적 국소 감독 없이도 글로벌 및 로컬 예측 간 일치를 강제함으로써 국소적 특징 학습을 효과적으로 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.