Skip to main content
QUICK REVIEW

[논문 리뷰] Rethinking Spatial Invariance of Convolutional Networks for Object Counting

Zhi-Qi Cheng, Qi Dai|arXiv (Cornell University)|2022. 06. 10.
Video Surveillance and Tracking Methods인용 수 9
한 줄 요약

이 논문은 객체 수를 세는 데 있어 공간 불변성의 증가가 성능을 향상시킨다는 기존의 통념을 도전하며, 과도하게 엄격한 픽셀 수준의 공간 불변성이 밀도 맵의 노이즈에 과적합되는 원인가 되며, 이를 해결하기 위해 저랭크 근사와 함께 가우시안 컨볼루션을 제안한다. 이는 공간 불변성을 완화시켜 객체 위치 학습을 향상시키며, 인파, 차량, 식물 수 세기 분야의 7개 벤치마크에서 최고 성능을 달성한다.

ABSTRACT

Previous work generally believes that improving the spatial invariance of convolutional networks is the key to object counting. However, after verifying several mainstream counting networks, we surprisingly found too strict pixel-level spatial invariance would cause overfit noise in the density map generation. In this paper, we try to use locally connected Gaussian kernels to replace the original convolution filter to estimate the spatial position in the density map. The purpose of this is to allow the feature extraction process to potentially stimulate the density map generation process to overcome the annotation noise. Inspired by previous work, we propose a low-rank approximation accompanied with translation invariance to favorably implement the approximation of massive Gaussian convolution. Our work points a new direction for follow-up research, which should investigate how to properly relax the overly strict pixel-level spatial invariance for object counting. We evaluate our methods on 4 mainstream object counting networks (i.e., MCNN, CSRNet, SANet, and ResNet-50). Extensive experiments were conducted on 7 popular benchmarks for 3 applications (i.e., crowd, vehicle, and plant counting). Experimental results show that our methods significantly outperform other state-of-the-art methods and achieve promising learning of the spatial position of objects.

연구 동기 및 목표

  • 심화된 공간 불변성이 컨볼루션 네트워크에서 객체 수 세기 성능을 저해하는지 조사하기.
  • 밀도 맵의 노이즈(annotation 오류 및 커널 겹침으로 인한 것)가 모델 일반화 및 예측 안정성에 미치는 영향 분석하기.
  • 엄격한 픽셀 수준의 공간 불변성을 완화시켜 진짜 객체 위치와 분포를 더 잘 학습할 수 있도록 하는 방법 제안하기.
  • 표준 컨벌루션을 가우시안 컨벌루션으로 대체함으로써 밀도 맵 노이즈에 대한 강인성 향상과 수치 정확도 향상을 입증하기.

제안 방법

  • 특징 추출 과정에서 공간적 위치를 더 민첩하게 모델링하기 위해 표준 컨벌루션 필터를 국소 연결된 가우시안 커널로 대체하기.
  • 대규모 가우시안 컨벌루션을 효율적으로 계산하기 위해 저랭크 근사를 도입하여 계산 비용을 줄이면서도 공간 모델링 능력을 유지하기.
  • 주요 레이어(예: 잔차 블록, 공간 피라미드 풀링)에 기존 네트워크(MCNN, CSRNet, SANet, ResNet-50)에 가우시안 컨벌루션 통합하기.
  • 차별 가능한 방식으로 종단 간(end-to-end)으로 방법 적용하여, 최종 밀도 맵 뿐 아니라 특징 학습 과정에서 직접 공간적 구조를 학습할 수 있도록 하기.
  • 성능과 과적합 간 균형을 맞추기 위해 다중 해상도 가우시안 커널 크기(K)를 적응적으로 설정하기(예: 잔차 블록에서는 K=4, 공간 피라미드 레이어에서는 K=16).
  • 표준 회귀 손실과 학습률 감소를 사용하여 훈련함으로써, 수정된 인덕티브 바이어스에도 불구하고 수렴 안정성 확보하기.

실험 결과

연구 질문

  • RQ1CNN에서 픽셀 수준의 공간 불변성을 증가시키는 것이 실제로 객체 수 세기 성능을 향상시키는가, 아니면 밀도 맵 노이즈에 과적합을 유도하는가?
  • RQ2밀도 맵 생성 과정에서 발생하는 annotation 오류와 커널 겹침이 모델 예측 분산과 일반화 능력에 어떤 영향을 미치는가?
  • RQ3표준 컨벌루션을 가우시안 컨벌루션으로 대체함으로써 모델이 진짜 객체 위치와 분포를 더 잘 학습할 수 있는가?
  • RQ4객체 수 세기 네트워크에서 공간 불변성과 공간 민감도 사이의 최적의 트레이드오���은 무엇인가?
  • RQ5가우시안 컨벌루션을 통한 공간 불변성 완화가 다양한 수 세기 벤치마크에서 일관된 성능 향상을 이끌어내는가?

주요 결과

  • 과도한 픽셀 수준의 공간 불변성은 밀도 맵의 노이즈에 과적합되며, 성능이 향상된다는 점조차도 높은 예측 분산을 유발한다.
  • 기존 베이스라인(MCNN, CSRNet, SANet, ResNet-50)은 20번의 랜덤 훈련 실행 동안 상당한 예측 분산을 보이며, 총 오차의 약 25%가 분산에 기인해, 고밀도 및 저밀도 영역 모두에서 문제가 된다.
  • SHTech ParA, UCF-QNRF, JHU-CROWD++에서의 아블레이션 스터디를 통해 제안된 저랭크 근사를 통한 가우시안 컨벌루션은 표준 컨벌루션 대비 예측 분산을 크게 감소시킴을 입증했다.
  • 인파, 차량, 식물 수 세기 분야의 7개 주요 벤치마크에서 최고 성능을 기록했으며, 기존 SOTA 방법 대비 MAE 및 MSE 지표에서 모두 승리했다.
  • 최적의 커널 크기(K)는 네트워크 구조에 따라 달라지며, 잔차 블록에서는 K=4, 공간 피라미드 풀링에서는 K=16, 다중 컬럼 아키텍처에서는 K=2–32로 설정되며, 아키텍처 설계에 민감함을 보임을 시사한다.
  • 실제 객체 위치와 분포를 더 잘 학습할 수 있음을 입증했으며, 정위치 정확도 향상과 annotation 노이즈에 대한 과적합 감소로 확인된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.