[논문 리뷰] STCrowd: A Multimodal Dataset for Pedestrian Perception in Crowded Scenes
이 논문은 219만 개의 3D 애너테이션을 가진 대규모 다중모odal 데이터셋인 STCrowd를 소개한다. 이 데이터셋은 매우 혼잡한 환경에서 동기화된 LiDAR 포인트 클라우드와 카메라 이미지를 포함한다. 또한, 공간적 어텐션과 다중 수준 히트맵을 활용하여 LiDAR 기반 보행자 검출 및 추적 성능을 향상시키는 새로운 방법인 밀도 인식 계층적 히트맵 통합(DHA)을 제안한다. 이는 STCrowd에서 최신 기술 수준의 성능을 달성하며, 다양한 백본과 작업에 일반화된다.
Accurately detecting and tracking pedestrians in 3D space is challenging due to large variations in rotations, poses and scales. The situation becomes even worse for dense crowds with severe occlusions. However, existing benchmarks either only provide 2D annotations, or have limited 3D annotations with low-density pedestrian distribution, making it difficult to build a reliable pedestrian perception system especially in crowded scenes. To better evaluate pedestrian perception algorithms in crowded scenarios, we introduce a large-scale multimodal dataset,STCrowd. Specifically, in STCrowd, there are a total of 219 K pedestrian instances and 20 persons per frame on average, with various levels of occlusion. We provide synchronized LiDAR point clouds and camera images as well as their corresponding 3D labels and joint IDs. STCrowd can be used for various tasks, including LiDAR-only, image-only, and sensor-fusion based pedestrian detection and tracking. We provide baselines for most of the tasks. In addition, considering the property of sparse global distribution and density-varying local distribution of pedestrians, we further propose a novel method, Density-aware Hierarchical heatmap Aggregation (DHA), to enhance pedestrian perception in crowded scenes. Extensive experiments show that our new method achieves state-of-the-art performance for pedestrian detection on various datasets.
연구 동기 및 목표
- 혼잡한 환경에서 풍부한 애너테이션이 제공되는 대규모, 고밀도 3D 보행자 인식 데이터셋의 부족을 해결하기 위해.
- 극도로 가림이 발생하고 혼잡한 군중 환경에서 보행자 검출, 추적, 궤적 예측의 강력한 평가를 가능하게 하기 위해.
- 혼잡한 환경에서 보행자의 희박한 전반적 분포와 밀도가 변하는 局부적 분포를 효과적으로 다룰 수 있는 방법을 개발하기 위해.
- LiDAR 전용, 이미지 전용, 센서 융합 기반 인식 작업을 위한 종합적인 베이스라인과 메트릭스를 제공하기 위해.
제안 방법
- 공간 어텐션 모듈(SAM)과 계층적 히트맵 통합(HH) 모듈를 결합한 이중 모듈 프레임워크인 밀도 인식 계층적 히트맵 통합(DHA)을 제안한다.
- 공간 어텐션 모듈을 통해 네트워크의 능력을 관련된 전경 영역에 집중시켜, 혼잡하고 가려진 영역에 대한 어텐션을 향상시킨다.
- 다중 수준의 특징 맵을 사용하여 다중 공간 스케일에서 보행자 밀도 변화를 모델링하기 위해 계층적 히트맵 통합 기법을 활용한다.
- 엔드 투 엔드 훈련 및 추론을 위해 LiDAR 기반 검출 백본(예: Pillar-Center, Voxel-Center, PointAugmenting)에 DHA를 통합한다.
- 중심점 기반 모델에 대해 속도 예측 헤드를 통합하여 3D 추적에 DHA를 적용하고 성능을 평가한다.
- STCrowd 데이터를 사용하여 표준 모델(LSTM, Social-LSTM, StarNet)을 활용해 궤적 예측으로 프레임워크를 확장한다.

실험 결과
연구 질문
- RQ1밀도 높은 3D 애너테이션을 가진 다중모달 데이터셋은 어떻게 극도로 혼잡한 환경에서의 보행자 인식 평가를 향상시킬 수 있는가?
- RQ2밀도 변화가 있는 보행자 분포를 고려한 방법은 얼마나 많은 가림과 혼잡한 환경에서 검출 및 추적 성능 향상에 기여하는가?
- RQ3학습 가능한 어텐션과 계층적 통합 메커니즘은 밀도가 높은 군중 상황에서 표준 검출 백본을 능가할 수 있는가?
- RQ4제안된 DHA 방법은 다양한 LiDAR 기반 검출 및 추적 아키텍처에 어떻게 일반화되는가?
- RQ5복잡한 군중 환경에서 다중모달 융합과 DHA는 궤적 예측 성능에 어떤 기여를 하는가?
주요 결과
- Pillar-Center 백본을 사용할 때 DHA 방법은 STCrowd 검증 세트에서 mAP 0.617을 달성하여 기준 모델 대비 5.6% 향상되었다.
- 제거 실험 결과, 공간 어텐션 모듈과 계층적 히트맵 구성 요소 모두가 기여하며, Voxel-Center 기준으로 DHA는 mAP를 3.5% 향상시켰다.
- 3D 추적에서 DHA는 MOTA를 Voxel-Center 기준 0.342에서 0.368로 향상시켜 다양한 작업에 대한 강력한 일반화 능력을 입증했다.
- 오직 LiDAR 특징만 사용할 경우에도 경쟁적인 성능를 달성하여 일부 센서 융합 기반 기준 모델보다 뛰어나, 가림 상황에서의 효과성을 입증했다.
- 궤적 예측에서 StarNet은 STCrowd 데이터를 사용해 FDE 0.983과 MDE 0.404를 달성하여, 이는 군중 역학을 고도로 모델링할 수 있음을 보여주었다.
- STCrowd 데이터셋은 평균 20명의 보행자, 최대 30명 이상의 극단적 혼잡 환경에서 219만 개의 보행자 인스턴스를 포함하며, nuScenes나 KITTI보다 훨씬 더 높은 밀도를 지닌다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.