[논문 리뷰] Locate, Size and Count: Accurately Resolving People in Dense Crowds via Detection
논문은 LSC-CNN을 제시한다. 이는 밀집한 군중에서 머리의 위치 추정(localization) 및 수를 세는 것(counting)에서 밀도 회귀 방법보다 우수한 위치화 성능을 보이는 밀집 검출 프레임워크이다.
We introduce a detection framework for dense crowd counting and eliminate the need for the prevalent density regression paradigm. Typical counting models predict crowd density for an image as opposed to detecting every person. These regression methods, in general, fail to localize persons accurate enough for most applications other than counting. Hence, we adopt an architecture that locates every person in the crowd, sizes the spotted heads with bounding box and then counts them. Compared to normal object or face detectors, there exist certain unique challenges in designing such a detection system. Some of them are direct consequences of the huge diversity in dense crowds along with the need to predict boxes contiguously. We solve these issues and develop our LSC-CNN model, which can reliably detect heads of people across sparse to dense crowds. LSC-CNN employs a multi-column architecture with top-down feedback processing to better resolve persons and produce refined predictions at multiple resolutions. Interestingly, the proposed training regime requires only point head annotation, but can estimate approximate size information of heads. We show that LSC-CNN not only has superior localization than existing density regressors, but outperforms in counting as well. The code for our approach is available at https://github.com/val-iisc/lsc-cnn.
연구 동기 및 목표
- 밀집한 군중에서 정확한 머리 위치 추정으로의 진전을 위해 밀도 회귀를 넘어 나아가려는 동기를 제시한다.
- 극심한 군집 밀도와 다양한 스케일에 맞춘 단일 스테이지의 밀집 검출 프레임워크를 개발한다.
- 포인트 머리 주석에서 도출된 경계 상자 예측으로 머리 위치 추정을 가능하게 한다.
- 명시적 박스 주석 없이 경계 상자 크기를 추정하는 학습 방식을 제공한다.
제안 방법
- LSC-CNN을 제안한다. 이는 다중 스케일에 걸쳐 미리 정의된 머리 상자 크기에 대해 픽셀 단위 클래스 확신도를 예측하는 밀집 검출 아키텍처이다.
- 수정된 VGG-16을 기반으로 한 다중 스케일 특징 추출기를 사용하여 half, one-fourth, one-eighth, 그리고 one-sixteenth 해상도의 특징 맵을 생성한다.
- 정밀한 위치화를 위한 맥락을 제공하기 위해 다중 스케일 특징을 융합하는 Top-down Feature Modulators(TFMs)을 도입한다.
- 포인트 주석으로부터 유도된 의사 그라운드트루스를 사용하여 미리 정의된 박스 클래스에 대한 픽셀 단위 교차 엔트로피 손실로 학습한다.
- 작업은 GWTA 학습 손실을 사용하여 어려운 영역에 학습을 집중시키고 지역적 최솟값을 완화하며 스케일- 및 클래스-균형 가중치를 적용한다.
- 근접 이웃 거리로 머리 크기를 근사하여 스케일 간 의사 그라운드 트루스 박스 빈을 생성한다.
실험 결과
연구 질문
- RQ1Dense 군중 카운팅을 효과적으로 밀도 회귀가 아닌 픽셀 단위 머리 탐지 문제로 재정의할 수 있는가?
- RQ2다중 스케일 특성과 상향-하향 맥락이 매우 밀집된 군중에서 머리의 위치 추정과 크기 설정을 얼마나 개선하는가?
- RQ3포인트 머리 주석만으로 경계 상자 주석 없이 머리 탐지 모델을 학습하는 것이 가능할까?
- RQ4의사 그라운드 트루스를 활용한 픽셀 단위 박스 분류 접근법이 밀도 범위에 따라 정확한 카운트를 제공하는가?
주요 결과
- LSC-CNN은 밀도 회귀 방식에 비해 더 우수한 위치화 성능을 달성한다.
- 모델은 머리에 대한 경계 상자를 제공하고 다양한 군중 밀도에서 정확한 수를 산출한다.
- Top-down 특징 조절은 다양한 스케일의 사람들을 해상도에 따라 구분하는 데 도움을 주고 혼잡한 장면에서 오탐을 줄인다.
- GWTA 손실과 포인트 기반 의사 감독으로 명시적 박스 주석 없이도 엔드 투 엔드 학습이 효과적으로 이루어진다.
- 이 방법은 밀집 군중에 대해 일반적인 얼굴 탐지기보다 높은 해상도 탐지를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.