[논문 리뷰] Congested Crowd Instance Localization with Dilated Convolutional Swin Transformer
이 논문은 고도로 혼잡한 군중 시나리오에서 정밀한 인스턴스 로컬라이제이션을 위한 확장 컨볼루션 스윙 트랜스포머(DCST)를 제안한다. 스윙 트랜스포머 기반 구조에 확장 컨볼루션을 통합하여 넓은 수신장 특징 학습 능력을 향상시킨다. 제안된 방법은 기준 데이터셋에서 F1 측정치 77.5%와 MAE 84.2를 기록하며 최신 기술 수준의 성능을 달성했으며, 가림과 흐림이 발생하는 영역에서의 로컬라이제이션 성능을 크게 향상시켰다.
Crowd localization is a new computer vision task, evolved from crowd counting. Different from the latter, it provides more precise location information for each instance, not just counting numbers for the whole crowd scene, which brings greater challenges, especially in extremely congested crowd scenes. In this paper, we focus on how to achieve precise instance localization in high-density crowd scenes, and to alleviate the problem that the feature extraction ability of the traditional model is reduced due to the target occlusion, the image blur, etc. To this end, we propose a Dilated Convolutional Swin Transformer (DCST) for congested crowd scenes. Specifically, a window-based vision transformer is introduced into the crowd localization task, which effectively improves the capacity of representation learning. Then, the well-designed dilated convolutional module is inserted into some different stages of the transformer to enhance the large-range contextual information. Extensive experiments evidence the effectiveness of the proposed methods and achieve state-of-the-art performance on five popular datasets. Especially, the proposed model achieves F1-measure of 77.5\% and MAE of 84.2 in terms of localization and counting performance, respectively.
연구 동기 및 목표
- 매우 혼잡한 군중 시나리오에서 작은 객체, 상호 가림, 이미지 흐림 등으로 인해 성능이 저하되는 정밀한 인스턴스 수준의 로컬라이제이션 문제를 해결한다.
- 심한 가림과 흐림 상황에서 강건한 특징 추출이 어려운 전통적 모델의 한계를 극복하기 위해 맥락 표현 능력을 향상시킨다.
- 전략적 확장 컨볼루션 통합을 통해 비전 트랜스포머의 밀도 높은 군중 시나리오에서의 특징 추출 능력을 향상시킨다.
- 다양한 기준 데이터셋에서 군중 인스턴스 로컬라이제이션 및 수량 측정에 대해 최신 기술 수준의 성능을 달성한다.
제안 방법
- 군중 시나리오에서 계층적이고 글로벌-로컬 표현을 포착하기 위해 창 기반 스윙 트랜스포머를 백본 인코더로 통합한다.
- 스테이지 3와 4에 확장률이 각각 2와 3인 새로운 확장 컨볼루션 블록(DCB)을 삽입하여 수신장 크기를 확장한다.
- 각 스테이지 이후 트랜스포머의 특징 맵을 공간 형식으로 재구성하여 확장 컨볼루션의 효과적 적용을 가능하게 한다.
- 전체 해상도의 세그멘테이션 맵을 입력 크기와 일치시키기 위해 피처 피라미드 네트워크(FPN) 디코더를 사용하여 인스턴스 수준 예측을 생성한다.
- 다양한 스케일에서 장거리 맥락적 의존성을 유지하면서 국소 세부 정보를 보존하는 유연한 DCB 모듈을 설계한다.
- 성능 최적화를 위해 아블레이션 스터디를 통해 DCB의 배치 및 확장률을 최적화한다.

실험 결과
연구 질문
- RQ1스윙 트랜스포머 아키텍처의 어디에 확장 컨볼루션 블록을 삽입하면 고밀도 군중 상황에서 로컬라이제이션 성능을 최대화할 수 있는가?
- RQ2DCB 모듈에서 어떤 확장률 설정이 국소 세부 정보 보존과 장거리 맥락 인코딩 사이의 최적의 트레이드오프를 이룰 수 있는가?
- RQ3임계값 선택이 군중 인스턴스 로컬라이제이션에서 로컬라이제이션 F1 측정치와 수량 측정 MAE 사이의 트레이드오프에 어떤 영향을 미치는가?
- RQ4제안된 DCST가 기준 데이터셋에서 표준 스윙 트랜스포머 및 기타 최신 기술 수준 모델보다 얼마나 성능을 향상시키는가?
주요 결과
- 제안된 DCST는 다섯 개의 기준 데이터셋에서 최신 기술 수준의 F1 측정치 77.5%와 MAE 84.2를 기록하여 우수한 로컬라이제이션 및 수량 측정 성능을 입증했다.
- 스윙 트랜스포머의 스테이지 3와 4에 DCB를 삽입할 경우 최고의 성능을 기록했으며, NWPU-Crowd 검증 세트에서 F1 측정치 81.4%를 달성했다.
- 확장률 조합 {2, 3}을 가진 DCB가 최적의 균형을 이뤘으며, NWPU 데이터셋에서 F1 측정치 81.4%, 정밀도 84.1%, 재현율 79.0%를 기록했다.
- 임계값 0.44가 F1 측정치(81.45%)를 최대화했고, 임계값 0.32는 가장 낮은 MAE(38.71)를 기록하여 로컬라이제이션과 수량 측정 목표 간의 트레이드오프를 드러냈다.
- 표준 스윙 트랜스포머 및 기타 최신 기술 수준 모델보다 뚜렷하게 뛰어난 성능을 보였으며, 특히 소형, 가림, 흐린 군중 영역 처리에서 뛰어난 성능을 발휘했다.
- 아블레이션 스터디 결과, 얕은 스테이지(1과 2)에 DCB를 삽입할 경우 국소 특징 학습이 악화되며, 더 깊은 곳에 삽입할수록 구조적 세부 정보를 더 잘 유지하는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.