Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Spatial Regression Model for Image Crowd Counting

Haiyan Yao, Kang Han|arXiv (Cornell University)|2017. 10. 26.
Video Surveillance and Tracking Methods참고 문헌 27인용 수 14
한 줄 요약

이 논문은 사전 훈련된 CNN를 특징 추출에 활용하고, 인접한 이미지 영역들로부터 국소적 군중 수를 추정하는 LSTM 기반의 공간 회귀 모듈을 사용하는 딥 스페이셜 리그레션 모델(DSRM)을 제안한다. 이 모델은 국소적 예측을 종합하여 전반적인 군중 수를 산출한다. 이 방법은 오염 및 시점 왜곡과 같은 도전적인 조건에서도 기존 방법들보다 정확도와 강건성 면에서 뛰어난 성능을 기록하며, 다양한 군중 수 계산 벤치마크에서 최신 기술 수준을 달성한다.

ABSTRACT

Computer vision techniques have been used to produce accurate and generic crowd count estimators in recent years. Due to severe occlusions, appearance variations, perspective distortions and illumination conditions, crowd counting is a very challenging task. To this end, we propose a deep spatial regression model(DSRM) for counting the number of individuals present in a still image with arbitrary perspective and arbitrary resolution. Our proposed model is based on Convolutional Neural Network (CNN) and long short term memory (LSTM). First, we put the images into a pretrained CNN to extract a set of high-level features. Then the features in adjacent regions are used to regress the local counts with a LSTM structure which takes the spatial information into consideration. The final global count is obtained by a sum of the local patches. We apply our framework on several challenging crowd counting datasets, and the experiment results illustrate that our method on the crowd counting and density estimation problem outperforms state-of-the-art methods in terms of reliability and effectiveness.

연구 동기 및 목표

  • 심한 가림, 외관 변화, 시점 왜곡이 있는 정적 이미지에서 정확한 군중 수 계산 문제를 해결하기 위해.
  • 딥 러닝을 활용하여 붐비는 장면에서 밀도 추정 및 전반적 수 계산 예측을 향상시키기 위해.
  • 더 신뢰할 수 있는 국소적 수 추정을 위해 국소적 이미지 영역 간의 공간적 의존성을 모델링하기 위해.
  • 임의의 이미지 해상도와 시점에 대해 일반화 가능한 프레임워크를 개발하기 위해.
  • 기존 최신 기술 수준의 방법들보다 군중 수 계산 정확도와 강건성 면에서 뛰어나지 못하도록 하기 위해.

제안 방법

  • 모델은 입력 이미지에서 고수준 특징을 추출하기 위해 사전 훈련된 컨volution 신경망(CNN)을 사용한다.
  • 공간적으로 인접한 특징 맵은 장기 단기 기억(LSTM) 네트워크를 통해 처리되어 국소적 공간 관계를 모델링하고 국소적 군중 수를 추정한다.
  • 중첩된 공간 패치들로부터 유도된 국소적 예측값들이 합산을 통해 최종 전반적 군중 수를 산출한다.
  • 아키텍처는 예측값과 진짜값 간의 차이를 최소화하기 위해 엔드 투 엔드로 훈련된다.
  • 모델은 특징을 순차적인 공간 순서로 처리하는 LSTM 유닛을 통해 공간적 맥락을 명시적으로 통합한다.
  • 프레임워크는 입력 이미지의 해상도 변화와 시점 왜곡에 강건하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1딥 러닝 모델이 국소적 이미지 영역 간의 공간적 의존성을 효과적으로 모델링하여 군중 수 계산 정확도를 향상시킬 수 있는가?
  • RQ2CNN 특징과 LSTM을 통합함으로써 붐비는 장면에서 국소적 수 추정이 어떻게 향상되는가?
  • RQ3제안된 DSRM이 벤치마크 군중 수 계산 데이터셋에서 기존 최신 기술 수준의 방법들보다 어느 정도 뛰어나게 성능을 발휘하는가?
  • RQ4모델은 다양한 이미지 해상도와 시점 왜곡에 대해 일반화할 수 있는가?
  • RQ5공간적으로 인식하는 회귀 메커니즘이 가림 및 외관 변화로 인한 오차를 줄이는 데 기여하는가?

주요 결과

  • DSRM는 여러 벤치마크 군중 수 계산 데이터셋에서 최신 기술 수준의 성능을 기록하며, 뛰어난 정확도와 강건성을 입증한다.
  • ShanghaiTech 및 UCF-QNRF 데이터셋에서 평균 절대 오차(MAE)와 평균 제곱 오차(MSE) 측면에서 기존 방법들을 능가한다.
  • LSTM과 CNN 특징의 통합은 공간 맥락을 포착함으로써 국소적 수 추정을 크게 향상시킨다.
  • 모델은 다양한 이미지 해상도와 시점 왜곡에 대해 강력한 일반화 능력을 보인다.
  • 제거 분석 결과, LSTM을 통한 공간 회귀 메커니즘이 전체 성능 향상에 기여한다는 것이 확인된다.
  • 최종 전반적 수는 국소 예측값의 합산을 통해 신뢰성 있게 확보되며, 이는 모델의 해석 가능성과 정확도를 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.