[논문 리뷰] Locality-constrained Spatial Transformer Network for Video Crowd Counting
이 논문은 인접 프레임 간의 공간-시간적 의존성을 국소성 제약이 있는 공간 변환기 모듈을 사용하여 명시적으로 모델링하는 국소성 제약이 있는 공간 변환기 네트워크(LSTN)를 제안한다. 이미지를 블록으로 나누고, 이격된 블록 간 유사도를 가중치로 사용하여 왜곡 오차를 조정함으로써, 가림과 운동이 있는 역동적 장면에서 밀도 맵 추정을 향상시킨다. 다양한 데이터셋에서 최신 기술 수준의 성능을 달성하며, 15,000 프레임과 394,081개의 애너테이션 헤드를 포함한 가장 큰 영상 군중 수세기 데이터셋인 FDST를 제작한다.
Compared with single image based crowd counting, video provides the spatial-temporal information of the crowd that would help improve the robustness of crowd counting. But translation, rotation and scaling of people lead to the change of density map of heads between neighbouring frames. Meanwhile, people walking in/out or being occluded in dynamic scenes leads to the change of head counts. To alleviate these issues in video crowd counting, a Locality-constrained Spatial Transformer Network (LSTN) is proposed. Specifically, we first leverage a Convolutional Neural Networks to estimate the density map for each frame. Then to relate the density maps between neighbouring frames, a Locality-constrained Spatial Transformer (LST) module is introduced to estimate the density map of next frame with that of current frame. To facilitate the performance evaluation, a large-scale video crowd counting dataset is collected, which contains 15K frames with about 394K annotated heads captured from 13 different scenes. As far as we know, it is the largest video crowd counting dataset. Extensive experiments on our dataset and other crowd counting datasets validate the effectiveness of our LSTN for crowd counting.
연구 동기 및 목표
- 운동, 가림, 시점 변화로 인해 영상 프레임 간에 밀도 추정이 일관되지 않는 문제를 해결한다.
- 암묵적인 RNN 기반 방법에 의존하는 대신, 인접 프레임 간의 공간-시간 일관성을 명시적으로 모델링하여 영상 군중 수세기의 강인성을 향상시킨다.
- 작은 크기이자 프레임 단위 애너테이션이 부족한 기존 데이터셋의 한계를 보완하기 위해, 13개의 다양한 장면을 포함한 새로운 대규모 영상 군중 수세기 데이터셋을 수집한다.
- 사람이 들어오거나 나가거나 가려지는 등의 역동적 장면 변화에 대응하기 위해, 변환 추정을 공간 블록으로 국소화함으로써 방법의 적응성을 높인다.
- 유사도 기반 국소화된 밀도 맵 왜곡이 영상 군중 수세기에서 전역 변환 또는 암묵적 역사 모델링보다 성능이 뛰어나다는 것을 입증한다.
제안 방법
- 각 영상 프레임에 대해 밀도 맵을 회귀하기 위해 컨volutional 신경망(CNN)을 사용한다.
- 국소성 제약이 있는 공간 변환기(LST) 모듈이 이전 프레임의 밀도 맵을 변형하여 현재 프레임의 밀도 맵을 예측한다. 이때 블록 단위의 공간 변환을 사용한다.
- 각 프레임을 겹치지 않는 공간 블록으로 나누어 변환 추정을 국소화하고, 국소적 장면 변화에 대한 강인성을 향상시킨다.
- LST 모듈은 연속된 프레임의 대응 블록 간 유사도를 학습된 유사도 메트릭을 사용해 계산하며, 이는 왜곡된 밀도 맵과 진짜값 간의 차이를 가중치로 적용한다.
- 손실 함수는 블록 간에 왜곡된 맵과 진짜값 간의 가중 오차를 조합하여, 공간-시간 정렬이 가능한 엔드 투 엔드 학습을 가능하게 한다.
- 유사도가 높은 영역에서의 정확한 밀도 예측을 강조하기 위해, 병합된 손실을 사용하여 엔드 투 엔드로 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1암묵적인 RNN 기반 방법과 비교해 볼 때, 이웃 프레임 간에 명시적이고 블록 단위의 공간 변환은 영상 군중 수세기 정확도를 향상시키는가?
- RQ2공간 블록 간 국소적 유사도를 통합함으로써, 가림이나 사람의 진입/퇴장이 발생하는 상황에서 밀도 맵 추정에 어떤 영향을 미치는가?
- RQ3국소성 제약이 있는 접근 방식이 전역 공간 변환 또는 표준 ConvLSTM보다 군중 수세기의 시간 동적 특성을 모델링하는 데 더 우수한가?
- RQ4대규모로 프레임 단위로 애너테이션된 영상 군중 수세기 데이터셋은 영상 군중 수세기 모델의 평가 및 훈련에 얼마나 기여하는가?
- RQ5제안된 방법은 다양한 실생활 장면, 다양한 군중 운동 및 카메라 시점에서 일반화 가능한가?
주요 결과
- 제안된 LSTN 모델은 FDST 데이터셋에서 평균 절대 오차(MAE) 3.35를 달성하여, LST가 없는 기준 모델(MAE: 3.81)과 최신 기술 수준의 방법인 ConvLSTM(MAE: 4.48)을 모두 능가한다.
- UCSD 데이터셋에서 LSTN은 MAE 1.07과 MSE 1.39를 기록하여, MCNN(MAE: 1.07, MSE: 1.35)과 ConvLSTM(MAE: 1.30, MSE: 1.79)를 모두 초월한다.
- Mall 데이터셋에서 LSTN은 가장 낮은 MAE(2.00)와 MSE(2.50)를 기록하여, 양방향 ConvLSTM(MAE: 2.10, MSE: 2.70)를 능가한다.
- 절단 실험 결과, LST 모듈의 유사도 항목이 모든 데이터셋에서 성능 향상을 일관되게 높이며, FDST에서 이 항목을 포함할 경우 상대적 MAE가 12.6% 감소한다.
- 13개의 장면에서 15,000개의 프레임과 394,081개의 애너테이션 헤드를 포함하는 FDST 데이터셋은 지금까지 가장 큰 영상 군중 수세기 데이터셋이며, 프레임 단위의 애너테이션 덕분에 세밀한 평가가 가능하다.
- FDST 데이터셋에서 LSTN의 성능은 단일 이미지 기준 모델보다 뚜렷이 뛰어나며, 영상 군중 수세기에서 명시적 시간 모델링의 가치를 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.