[논문 리뷰] Cross-Modal Collaborative Representation Learning and a Large-Scale RGBT Benchmark for Crowd Counting
이 논문은 광학 및 열화상 영상을 융합하여 RGBT 군중 수세기 성능을 향상시키기 위해 정보 집약-분포 모듈(IADM)을 갖춘 다중모odal 공동 표현 학습 프레임워크를 제안한다. 이 방법은 새로 도입된 대규모 RGBT-CC 기준(2,030장의 영상 쌍, 138,389개의 레이블)과 상하이기술대RGBD 데이터셋에서 최신 기술 수준의 성능을 달성하여, 다양한 다중모달 환경에서 뛰어난 정확도와 일반화 능력을 입증한다.
Crowd counting is a fundamental yet challenging task, which desires rich information to generate pixel-wise crowd density maps. However, most previous methods only used the limited information of RGB images and cannot well discover potential pedestrians in unconstrained scenarios. In this work, we find that incorporating optical and thermal information can greatly help to recognize pedestrians. To promote future researches in this field, we introduce a large-scale RGBT Crowd Counting (RGBT-CC) benchmark, which contains 2,030 pairs of RGB-thermal images with 138,389 annotated people. Furthermore, to facilitate the multimodal crowd counting, we propose a cross-modal collaborative representation learning framework, which consists of multiple modality-specific branches, a modality-shared branch, and an Information Aggregation-Distribution Module (IADM) to capture the complementary information of different modalities fully. Specifically, our IADM incorporates two collaborative information transfers to dynamically enhance the modality-shared and modality-specific representations with a dual information propagation mechanism. Extensive experiments conducted on the RGBT-CC benchmark demonstrate the effectiveness of our framework for RGBT crowd counting. Moreover, the proposed approach is universal for multimodal crowd counting and is also capable to achieve superior performance on the ShanghaiTechRGBD dataset. Finally, our source code and benchmark are released at {\url{http://lingboliu.com/RGBT_Crowd_Counting.html}}.
연구 동기 및 목표
- RGB 영상만으로는 저조도 환경에서 보행자를 탐지하지 못하는 제약 조건이 있는 환경에서의 군중 수세기 과제를 해결하기 위해.
- 광학(RGB) 및 열화상 영상의 상호보완적 강점을 탐색하여 견고한 군중 밀도 추정을 위한 기반을 마련하기 위해.
- 다양한 다중모달 환경에서 효과적으로 교차모달 표현을 캡처할 수 있는 보편적이고 즉시 통합 가능한 프레임워크를 개발하기 위해.
- 미래 연구를 위한 기반을 마련하고자, 첫 번째 대규모, 다양한 종류의 도전 과제를 수반하는 RGBT 군중 수세기 기준을 구축하기 위해.
제안 방법
- 다양한 모달 전용 브랜치, 모달 공유 브랜치, 및 정보 집약-분포 모듈(IADM)을 활용하여 계층적인 교차모달 표현을 학습하는 프레임워크를 구현한다.
- IADM은 이중 정보 전파 메커니즘을 사용한다: 모든 모달 전용 특징에서의 맥락 정보를 활용하여 모달 공유 특징을 향상시키는 정보 집약 전달 기능.
- IADM은 또한 모달 공유 표현을 개선한 정보를 활용하여 각 모달 전용 특징을 정밀하게 보정하는 정보 분포 전달 기능을 포함한다.
- IADM은 여러 레이어에 걸쳐 통합되어 모달 전용 특징과 공유 특징 간의 계층적 융합 및 상호 강화를 가능하게 한다.
- 프레임워크는 즉시 통합 가능한 모듈로 설계되어, 다양한 백본 네트워크(예: CSRNet, MCNN, SANet)와 함께 통합되어 엔드 투 엔드 학습이 가능하다.
- IADM 내에서 다중 수용장치 영역 맥락 특징을 추출하기 위해 3단계의 피라미드 풀링 레이어를 사용한다.
실험 결과
연구 질문
- RQ1RGB와 열화상 영상의 융합이 도전적인 실세계 환경에서 군중 수세기 성능을 크게 향상시킬 수 있는가?
- RQ2딥 러닝 프레임워크 내에서 광학 및 열화상 모달 간의 상호보완적 정보를 효과적으로 캡처하고 활용할 수 있는가?
- RQ3교차모달 공동 표현 학습 기반의 통합 프레임워크가 RGBT 및 RGBD와 같은 다양한 다중모달 설정에서 일반화될 수 있는가?
- RQ4모달 간의 동적이고 이중 방향 정보 흐름을 위한 모듈러 구성 요소(IADM)의 최적 설계는 무엇인가?
- RQ5제안된 방법은 대규모 실세계 기준에서 최신 기술 수준 모델들과 비교해 정확도와 내구성 측면에서 어떻게 성과를 내는가?
주요 결과
- 제안된 CSRNet+IADM 모델은 GAME(0)가 4.38, RMSE가 7.05로 상하이기술대RGBD 기준에서 새로운 최신 기술 수준 성능을 달성하였다.
- 모든 제안된 프레임워크 사례(예: MCNN+IADM, SANet+IADM)는 RGBT-CC 기준에서 각각의 백본 네트워크 및 비교된 모든 최신 기술 수준 모델보다 뛰어난 성능을 보였다.
- IADM 모듈은 MCNN 및 SANet 백본에 적용했을 때 기존의 '조기 융합' 기반 모델 대비 RMSE에서 상대적으로 18.9% 향상된 성능을 기록하였다.
- 제거 실험 결과, IADM의 이중 정보 전파 메커니즘이 필수적임을 확인하였으며, 3단계 피라미드 풀링 레이어를 사용할 경우 최고의 성능을 달성하였다.
- 프레임워크는 보편적으로 효과적이다: RGBT 데이터 뿐 아니라 RGBD 데이터에서도 뛰어난 성능을 기록하여 일반화 능력을 입증하였다.
- 2,030장의 영상 쌍과 138,389개의 레이블을 포함하는 대규모 RGBT-CC 기준과 함께 코드가 함께 공개되어 향후 연구를 지원한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.