[논문 리뷰] Motion-guided Non-local Spatial-Temporal Network for Video Crowd Counting
이 논문은 영상 군중 수세기에서 공간-시간 상관관계, 특히 프레임 간 장거리 의존성을 효과적으로 모델링하지 못하는 문제를 해결하기 위해, 광학 흐름을 활용해 원시적인 인물 영역 분할을 유도하고, 비국소 네트워크를 통해 짧고 긴 거리의 공간-시간 맥락을 포착하는 운동 유도 비국소 공간-시간 네트워크인 Monet을 제안한다. Monet은 VidCrowd, Mall, UCSD 데이터셋에서 최신 기준 성능을 달성하며, UCSD 데이터셋에서 1.54 MAE, 과도한 도전 과제를 안고 있는 VidCrowd 데이터셋에서 1.17 MAE를 기록한다. 또한 9,000장의 고해상도 프레임과 115만 개의 헤드 애너테이션을 포함한 새로운 대규모 영상 군중 수세기 데이터셋인 VidCrowd를 제작한다.
We study video crowd counting, which is to estimate the number of objects (people in this paper) in all the frames of a video sequence. Previous work on crowd counting is mostly on still images. There has been little work on how to properly extract and take advantage of the spatial-temporal correlation between neighboring frames in both short and long ranges to achieve high estimation accuracy for a video sequence. In this work, we propose Monet, a novel and highly accurate motion-guided non-local spatial-temporal network for video crowd counting. Monet first takes people flow (motion information) as guidance to coarsely segment the regions of pixels where a person may be. Given these regions, Monet then uses a non-local spatial-temporal network to extract spatial-temporally both short and long-range contextual information. The whole network is finally trained end-to-end with a fused loss to generate a high-quality density map. Noting the scarcity and low quality (in terms of resolution and scene diversity) of the publicly available video crowd datasets, we have collected and built a large-scale video crowd counting datasets, VidCrowd, to contribute to the community. VidCrowd contains 9,000 frames of high resolution (2560 x 1440), with 1,150,239 head annotations captured in different scenes, crowd density and lighting in two cities. We have conducted extensive experiments on the challenging VideoCrowd and two public video crowd counting datasets: UCSD and Mall. Our approach achieves substantially better performance in terms of MAE and MSE as compared with other state-of-the-art approaches.
연구 동기 및 목표
- 영상 군중 수세기에서 공간-시간 상관관계, 특히 프레임 간 장거리 의존성을 효과적으로 모델링하지 못하는 문제를 해결하기 위해.
- 운동 정보(광학 흐름)를 인물 영역 국소화를 위한 공간 사전 정보로 통합하여 정확도를 향상시키기 위해.
- 밀도 맵 회귀를 위해 국소 및 비국소 공간-시간 맥락을 동시에 포착하는 딥 러닝 프레임워크를 개발하기 위해.
- 기존 영상 군중 수세기 데이터셋의 부족함과 저품질 문제를 해결하기 위해 새로운 대규모 고해상도 데이터셋인 VidCrowd를 제작하고 공개하기 위해.
- 다양한 환경, 조명 조건, 군중 밀도를 포함한 다양한 시나리오를 바탕으로 영상 군중 수세기의 새로운 벤치마크를 설정하기 위해.
제안 방법
- 운동 추정을 위해 광학 흐름을 사용하여 운동 벡터를 생성하고, 이를 통해 영상 프레임을 사람 영역을 포함할 가능성이 높은 영역으로 분할하여 공간 사전 정보를 제공한다.
- 운동 기반 분할을 유도로, 연속된 프레임에 대해 비국소 공간-시간 네트워크를 적용하여 공간과 시간에 걸쳐 국소(단거리) 및 비국소(장거리) 맥락적 특징을 추출한다.
- 예측된 밀도 맵을 점진적으로 개선하기 위해 캐스케이드 리파인먼트 모듈을 사용하며, 운동 유도 정보와 비국소 맥락을 통합한다.
- 전체 네트워크를 엔드 투 엔드로 훈련하기 위해 다중 감독 신호를 통합한 융합 손실 함수를 사용하여 밀도 맵 품질과 수세기 정확도를 향상시킨다.
- 프레임당 2560×1440 해상도의 고해상도(2560×1440) 프레임 총 9,000장, 총 1,150,239개의 헤드 애너테이션을 포함한 새로 수집한 VidCrowd 데이터셋을 기반으로 프레임워크를 훈련하고 평가한다.
실험 결과
연구 질문
- RQ1광학 흐름을 활용해 영상 프레임 내 인물 영역 국소화를 효과적으로 유도할 수 있는가?
- RQ2비국소 공간-시간 네트워크가 영상 시퀀스에서 장거리 의존성을 얼마나 잘 포착하여 군중 수세기 정확도를 향상시킬 수 있는가?
- RQ3운동 유도와 비국소 모델링을 통합한 통합 딥 러닝 프레임워크가 과도한 벤치마크에서 기존 영상 기반 군중 수세기 방법을 초월할 수 있는가?
- RQ4제안된 Monet 모델은 다양한 실제 조건을 반영한 새로운 대규모 고해상도 영상 군중 수세기 데이터셋에서 어떻게 성능을 발휘하는가?
주요 결과
- Monet은 UCSD 데이터셋에서 1.54 MAE와 2.02 MSE를 기록하여 모든 이전 영상 기반 방법을 능가하며, 이 벤치마크에서 최신 기준 성능을 달성한다.
- 최근 도입된 VidCrowd 데이터셋에서 Monet은 1.17 MAE와 1.45 MSE를 기록하여 MCNN, CSRNet, SACANet, ConvLSTM 등 비교된 모든 방법을 뛰어넘는 성능을 보였다.
- 제거 실험 결과, 운동 유도와 비국소 공간-시간 모듈이 모두 필수적임을 확인: 둘 중 하나를 제거하면 성능이 크게 저하되어 상호 보완적 역할을 한다는 것을 입증한다.
- Mall 데이터셋에서도 Monet은 2.10 MAE와 7.60 MSE로 최신 기준 성능을 달성하여 모든 기존 영상 기반 수세기 모델을 능가한다.
- 9,000장의 고해상도 프레임과 1,150,239개의 헤드 애너테이션을 포함한 새로운 VidCrowd 데이터셋은 다양한 시나리오, 조명 조건, 군중 밀도를 포함해 이전 데이터셋보다 더 다양하고 도전적인 벤치마크를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.