[논문 리뷰] Boosting Crowd Counting via Multifaceted Attention
이 논문은 다면적 주의망(MAN)을 제안하여 가변성이 높은 환경에서의 군중 수세기 성능을 향상시킨다. 학습 가능한 국소 주의, 국소 주의 정규화, 인스턴스 수준의 주의 감독을 도입하였다. MAN은 네 가지 기준 데이터셋에서 최신 기술 성능(SoTA)을 달성하였으며, 기준 방법 대비 MAE는 최대 15.1% 감소하고 MSE는 12.9% 감소하였다.
This paper focuses on the challenging crowd counting task. As large-scale variations often exist within crowd images, neither fixed-size convolution kernel of CNN nor fixed-size attention of recent vision transformers can well handle this kind of variation. To address this problem, we propose a Multifaceted Attention Network (MAN) to improve transformer models in local spatial relation encoding. MAN incorporates global attention from a vanilla transformer, learnable local attention, and instance attention into a counting model. Firstly, the local Learnable Region Attention (LRA) is proposed to assign attention exclusively for each feature location dynamically. Secondly, we design the Local Attention Regularization to supervise the training of LRA by minimizing the deviation among the attention for different feature locations. Finally, we provide an Instance Attention mechanism to focus on the most important instances dynamically during training. Extensive experiments on four challenging crowd counting datasets namely ShanghaiTech, UCF-QNRF, JHU++, and NWPU have validated the proposed method. Codes: https://github.com/LoraLinH/Boosting-Crowd-Counting-via-Multifaceted-Attention.
연구 동기 및 목표
- 고정된 수신 영역을 가진 CNN 및 고정 크기의 주의를 가진 비전 트랜스포머의 성능 저하를 초래하는 군중 이미지의 대규모 변동성 문제를 해결한다.
- 비전 트랜스포머의 국소 공간 인코딩을 향상시키기 위해 고정된 패치 기반 주의를 대체하여 각 특징 위치마다 동적이고 학습 가능한 영역 주의를 도입한다.
- 다른 특징 위치 간의 주의 가중치 편차를 최소화함으로써 주의 할당을 균형 있게 만들기 위한 새로운 국소 주의 정규화(LAR)를 도입한다.
- 군중 수세기에서 노이즈가 많거나 희소한 점 주석의 부정적 영향을 줄이기 위해 학습 중 가장 신뢰할 수 있는 인스턴스에 집중하는 동적 인스턴스 주의를 도입한다.
- 최소한의 계산 비용 증가로 여러 표준 군중 수세기 기준 데이터셋에서 최신 기술 성능(SoTA)을 달성한다.
제안 방법
- 학습 가능한 영역 주의(LRA)를 제안한다. 이는 각 특징 위치마다 고유한 수신 영역을 학습하는 동적 국소 주의 메커니즘으로, 표준 비전 트랜스포머의 고정 크기 패치를 대체한다.
- 국소 주의 정규화(LAR)를 도입한다. 이는 서로 다른 특징 위치 간의 주의 가중치 편차를 방지함으로써 균형 잡히고 효율적인 주의 할당을 촉진하는 학습 손실이다.
- 인스턴스 주의 손실(IAL)을 설계한다. 이는 학습 중에 낮은 품질이나 노이즈가 있는 점 주석을 동적으로 억제하여 가장 일관성 있는 예측에만 집중한다.
- LRA, LAR, IAL을 통합한 비전 트랜스포머 기반의 통합 수세기 프레임워크에 통합하여 글로벌 자기 주의와 함께 적응형 국소 및 인스턴스 수준 주의를 결합한다.
- CNN 백본을 사용해 특징을 추출하고, LRA가 포함된 트랜스포머 인코더를 거친 후, 밀도 맵 예측을 위한 회귀 헤드를 적용한다.
- 기본 회귀 손실과 함께 제안된 IAL 및 LAR 손실을 조합하여 전체 모델을 엔드 투 엔드로 최적화한다.
실험 결과
연구 질문
- RQ1학습 가능한 동적 국소 주의 메커니즘이 비전 트랜스포머의 국소 컨텍스트 인코딩을 군중 수세기에서 향상시킬 수 있는가?
- RQ2LAR를 통해 특징 위치 간 주의 분포를 정규화하면 더 견고하고 균형 잡힌 주의 할당이 이루어지는가?
- RQ3동적 인스턴스 수준 주의는 군중 수세기에서 노이즈가 많거나 희소한 점 주석에 대한 모델의 견고성을 향상시킬 수 있는가?
- RQ4글로벌, 국소, 인스턴스 수준 주의 메커니즘을 조합하면 다양한 군중 수세기 기준 데이터셋에서 일관된 성능 향상이 이루어지는가?
- RQ5기존의 CNN 및 비전 트랜스포머 기반 군중 수세기 모델과 비교해 제안된 MAN의 효율성과 정확도는 어떠한가?
주요 결과
- MAN은 상하이테크, UCF-QNRF, JHU++, NWPU 등 네 가지 주요 군중 수세기 기준 데이터셋에서 최신 기술 성능(SoTA)을 달성하였다.
- UCF-QNRF 데이터셋에서 기준 방법 BL 대비 MAE는 15.1% 감소하고 MSE는 12.9% 감소하였다.
- LRA만 추가해도 기준 방법 대비 MAE는 2.7% 향상되고 MSE는 3.5% 향상되었으며, IAL과 조합할 경우 추가로 성능 향상이 이루어졌다.
- 국소 주의 정규화(LAR)는 훈련을 크게 안정화시키고 주의 분포를 향상시켰으며, 인스턴스 주의 손실에서 δ=0.9일 때 최적 성능을 보였다.
- 모델은 낮은 계산 비용을 유지하였으며, ViT-B 및 VGG19+Trans 대비 FLOPs는 58.2 GFLOPs로 약간 증가했고, 추론 시간은 100장당 11.3초로 거의 동일했다.
- 시각화 결과 LRA가 더 작은 군중에는 주의 영역을 적응적으로 좁혀 인간과 유사한 주의 효율성을 재현함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.