Skip to main content
QUICK REVIEW

[논문 리뷰] Scene-Adaptive Attention Network for Crowd Counting

Xing Wei, Yuanrui Kang|arXiv (Cornell University)|2021. 12. 31.
Video Surveillance and Tracking Methods인용 수 8
한 줄 요약

이 논문은 다양한 군중 규모와 환경 레이아웃에 동적으로 적응할 수 있도록 변형 가능한 어텐션 메커니즘을 트랜스포머 기반 백본 내에 통합한 scene-adaptive attention network인 SAANet을 제안한다. 이 방법은 기존의 CNN 및 트랜스포머 기반 모델보다 향상된 정확도와 효율성을 바탕으로 NWPU-Crowd 벤치마크에서 최상위 성능을 기록하여 SOTA 성능을 달성한다.

ABSTRACT

In recent years, significant progress has been made on the research of crowd counting. However, as the challenging scale variations and complex scenes existed in crowds, neither traditional convolution networks nor recent Transformer architectures with fixed-size attention could handle the task well. To address this problem, this paper proposes a scene-adaptive attention network, termed SAANet. First of all, we design a deformable attention in-built Transformer backbone, which learns adaptive feature representations with deformable sampling locations and dynamic attention weights. Then we propose the multi-level feature fusion and count-attentive feature enhancement modules further, to strengthen feature representation under the global image context. The learned representations could attend to the foreground and are adaptive to different scales of crowds. We conduct extensive experiments on four challenging crowd counting benchmarks, demonstrating that our method achieves state-of-the-art performance. Especially, our method currently ranks No.1 on the public leaderboard of the NWPU-Crowd benchmark. We hope our method could be a strong baseline to support future research in crowd counting. The source code will be released to the community.

연구 동기 및 목표

  • 군중 수세기에서 고정된 수신장(CNN)과 창문 기반 어텐션(Transformer)의 한계를 해결하기 위해 척도 변화와 복잡한 환경을 다룰 수 있도록 하는 것.
  • 실제 바운딩 박스 정보에 의존하지 않고도 환경 레이아웃과 객체 척도 변화에 적응할 수 있는 유연한 어텐션 메커니즘을 개발하는 것.
  • 다중 수준 특징 병합 및 카운팅에 민감한 특징 증강 모듈을 통해 특징 표현과 밀도 추정을 향상시키는 것.
  • 기존 SOTA 모델 대비 계산 비용과 모델 파라미터 수를 줄이며 최상의 성능을 달성하는 것.

제안 방법

  • 학습 가능한 샘플링 오프셋과 동적 어텐션 가중치를 통해 적응형 특징 표현을 학습하는 데 목적이 있는, 변형 가능한 어텐션과 글로벌 어텐션을 결합한 새로운 트랜스포머 백본인 Deformer를 도입한다.
  • 공간적으로 적응 가능한 특징 집합을 허용하기 위해 변형 가능한 어텐션을 활용하여 군중에서 발생하는 시각적 왜곡과 척도 변화를 더 잘 모델링할 수 있도록 한다.
  • 다양한 스테이지 간의 특징을 효율적으로 융합하기 위해 변형 가능한 어텐션을 사용하는 다중 수준 특징 융합(MFF) 모듈을 제안한다. 이는 국소화 및 수세기 정확도를 향상시킨다.
  • 카운팅 손실 감독을 통한 트랜스포머 디코더 레이어 스택으로 구성된 카운팅에 민감한 특징 증강(CAFE) 모듈을 도입하여 학습된 어텐션 맵을 사용해 특징을 재조정한다.
  • Deformer에서 국소적 변형 가능한 어텐션과 글로벌 어텐션을 번갈아 사용하는 하이브리드 어텐션 전략을 적용하여 효율성과 표현 능력의 균형을 이루도록 한다.
  • 최종 수세기 결과를 위해 표준 밀도 회귀 헤드를 사용하며, L1/L2 손실을 적용하고 제안된 구성 요소들과 함께 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 백본 내에 변형 가능한 어텐션 메커니즘이 대규모 척도 변화와 복잡한 환경에서 군중 수세기의 특징 표현을 향상시키는 데 기여하는가?
  • RQ2고정 크기 창 기반 어텐션과 표준 자기어텐션 대비 제안된 Deformer 백본은 적응성과 성능 면에서 어떻게 비교되는가?
  • RQ3다중 수준 특징 융합과 카운팅에 민감한 특징 증강 기법이 수세기 정확도와 국소화 능력 향상에 얼마나 기여하는가?
  • RQ4제안된 방법은 최소한의 아키텍처 가정으로 다양한 군중 수세기 벤치마크에 일반화 가능한가?
  • RQ5기존 SOTA 방법 대비 계산 비용과 파라미터 수가 적은데도 불구하고 최상의 성능을 달성하는가?

주요 결과

  • SAANet는 NWPU-Crowd 벤치마크에서 최고 성능을 기록하여 공개 랭킹에서 1위를 차지했으며, MAE는 51.7, MSE는 80.1을 기록했다.
  • Deformer 백본은 Twins-large 및 Twins-base와 같은 더 큰 모델보다 뛰어난 성능을 보이며, 뛰어난 파라미터 효율성과 정확도를 입증했다.
  • 다중 수준 특징 융합(MFF) 모듈은 단일 수준 기준선 대비 MAE를 0.6 감소시키고 MSE를 2.1 감소시켰다.
  • 카운팅에 민감한 특징 증강(CAFE) 모듈은 기준선 대비 MAE를 1.0 감소시키고 MSE를 3.1 감소시켰다.
  • MFF와 CAFE의 조합은 기준선 대비 MAE를 2.1 감소시키고 MSE를 6.2 감소시켜 최고의 성능을 달성했다.
  • 시각화 결과는 변형 가능한 어텐션의 샘플링 포인트와 오프셋이 실제 객체 크기와 양의 상관관계를 보이며, 실질적인 바운딩 박스 없이도 이를 인지할 수 있음을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.