[논문 리뷰] PDANet: Pyramid Density-aware Attention Net for Accurate Crowd Counting
PDANet는 다중 해상도 특징, 공간 및 채널 주의 모듈, 그리고 입력 영상의 밀도에 따라 고밀도 또는 저밀도 브랜치를 동적으로 선택하는 밀도 인식 디코더를 활용하여 정확한 군중 수세기 모델을 제안한다. 이는 UCF-Crowd50에서 MAE를 35% 이상 감소시키며, ShanghaiTech, WorldExpo10, UCSD를 포함한 여러 벤치마크에서 기존 방법들을 능가하는 최신 기술 성능을 달성한다.
Crowd counting, i.e., estimating the number of people in a crowded area, has attracted much interest in the research community. Although many attempts have been reported, crowd counting remains an open real-world problem due to the vast scale variations in crowd density within the interested area, and severe occlusion among the crowd. In this paper, we propose a novel Pyramid Density-Aware Attention-based network, abbreviated as PDANet, that leverages the attention, pyramid scale feature and two branch decoder modules for density-aware crowd counting. The PDANet utilizes these modules to extract different scale features, focus on the relevant information, and suppress the misleading ones. We also address the variation of crowdedness levels among different images with an exclusive Density-Aware Decoder (DAD). For this purpose, a classifier evaluates the density level of the input features and then passes them to the corresponding high and low crowded DAD modules. Finally, we generate an overall density map by considering the summation of low and high crowded density maps as spatial attention. Meanwhile, we employ two losses to create a precise density map for the input scene. Extensive evaluations conducted on the challenging benchmark datasets well demonstrate the superior performance of the proposed PDANet in terms of the accuracy of counting and generated density maps over the well-known state of the arts.
연구 동기 및 목표
- 이미지 전반에 걸쳐 균일한 혼잡 수준을 가정하는 기존 방법들이 직면한 극단적인 밀도 변화 문제를 해결한다.
- 로컬 혼잡 수준에 맞게 네트워크 동작을 적응시켜 흩어진 군중과 고밀도 군중 장면 모두에서 정확도를 향상시킨다.
- 패치 기반 또는 다중 컬럼 처리 방식에서 발생하는 불필요한 계산을 피하는 경량이고 효율적인 아키텍처를 설계한다.
- 소음을 억제하고 관련성이 있는 군중 패턴을 강조하기 위해 공간 및 채널 주의를 사용하여 특징 표현을 향상시킨다.
- 장면의 혼잡 수준을 기반으로 특징을 적절한 브랜치로 라우팅하는 밀도 인식 디코더를 개발한다.
제안 방법
- 계층적 특징을 추출하기 위해 VGG16을 인코더로 사용하고, 다중 해상도 특징 학습을 위해 글로벌 평균 풀링, 1×1 컨볼루션, 3×3 커널을 가진 확장 컨볼루션의 연속을 적용한다.
- 다양한 레이어에 채널 및 공간 주의 모듈을 적용하여 분류 능력 있는 특징을 강화하고 관련 없는 또는 노이즈가 많은 활성화를 억제한다.
- 입력 이미지의 총 혼잡 수준을 예측하기 위한 분류 헤드를 도입하여, 고밀도 또는 저밀도 브랜치로의 특징 라우팅을 안내한다.
- 고밀도 및 저밀도 영역을 위한 별도의 헤드를 가진 이중 브랜치 디코더(DAD)를 사용하여 장면 유형에 맞는 적응형 특징 학습을 가능하게 한다.
- 최종 밀도 맵 생성을 위해 공간적으로 적응형 가중치를 학습하는 시그모이드 게이팅 주의 메커니즘을 사용해 두 브랜치 출력을 융합한다.
- 정밀한 밀도 맵 생성과 수세기 정확도 향상을 위해 L1 및 L2 손실 함수의 조합을 사용해 네트워크를 훈련시킨다.
실험 결과
연구 질문
- RQ1단일 딥 네트워크 아키텍처가 한 장의 이미지 내에서 극단적인 밀도 변화를 효과적으로 다룰 수 있는가?
- RQ2특화된 디코더 브랜치로 특징을 동적으로 라우팅하는 방식이 군중 수세기 정확도를 어떻게 향상시키는가?
- RQ3주의 메커니즘과 다중 해상도 특징이 흩어진 군중과 고밀도 군중 장면 양쪽에서 성능 향상에 얼마나 기여하는가?
- RQ4밀도 인식 분류기가 다양한 군중 수세기 벤치마크 간 일반화 능력을 향상시킬 수 있는가?
- RQ5다중 해상도 밀도 맵을 융합하기 위한 제안된 게이팅 메커니즘이 기존 융합 전략보다 더 나은 최종 수세기 결과를 도출하는가?
주요 결과
- ShanghaiTech-A 데이터셋에서 PDANet는 MAE 58.5와 MSE 93.4를 기록하여 PaDNet, ADCrowdNet, HA_CNN를 포함한 최신 기술 방법들을 능가한다.
- ShanghaiTech-B에서 PDANet는 MAE 7.1과 MSE 10.9를 기록하여 고밀도 장면에서 강력한 성능을 보여준다.
- WorldExpo10 데이터셋에서 PDANet는 평균 MAE 6.0을 기록하여 이전 최고 기록(CAN)을 1.4 MAE 포인트 이상 앞서며 우수한 성능을 확보한다.
- 가장 도전적인 UCF-Crowd50 데이터셋에서 PDANet는 PaDNet 대비 MAE를 35% 이상 감소시켜 119.8 MAE와 159 MSE를 기록한다.
- UCSD에서 PDANet는 MAE 0.93과 MSE 1.21을 기록하여 최고 성능을 낸 PaDNet 모델에 매우 가까운 두 번째 순위 성능을 달성한다.
- 절단 실험 결과, 피라미드 특징, 주의 모듈, 밀도 인식 디코더의 조합이 성능 향상에 필수적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.