[논문 리뷰] $A^2$-Nets: Double Attention Networks
이 논문은 $A^2$-Nets를 제안하며, 이는 두 단계의 주의 메커니즘을 통해 장거리 공간적 및 시간적 의존성을 포착함으로써 CNN의 성능을 향상시키는 더블 어텐션 블록이다. 첫 번째로 두 번째 순서 통계를 통해 전역 특징을 풀링하고, 두 번째로 이를 각 위치에 적응적으로 분배한다. 이 방법은 ResNet-152와 같은 더 깊은 모델보다 훨씬 적은 파라미터와 FLOPs를 사용하면서도 ImageNet-1k, Kinetics, UCF-101에서 최고 성능을 기록한다.
Learning to capture long-range relations is fundamental to image/video recognition. Existing CNN models generally rely on increasing depth to model such relations which is highly inefficient. In this work, we propose the "double attention block", a novel component that aggregates and propagates informative global features from the entire spatio-temporal space of input images/videos, enabling subsequent convolution layers to access features from the entire space efficiently. The component is designed with a double attention mechanism in two steps, where the first step gathers features from the entire space into a compact set through second-order attention pooling and the second step adaptively selects and distributes features to each location via another attention. The proposed double attention block is easy to adopt and can be plugged into existing deep neural networks conveniently. We conduct extensive ablation studies and experiments on both image and video recognition tasks for evaluating its performance. On the image recognition task, a ResNet-50 equipped with our double attention blocks outperforms a much larger ResNet-152 architecture on ImageNet-1k dataset with over 40% less the number of parameters and less FLOPs. On the action recognition task, our proposed model achieves the state-of-the-art results on the Kinetics and UCF-101 datasets with significantly higher efficiency than recent works.
연구 동기 및 목표
- 지역적 수신장으로 인해 표준 CNN의 장거리 의존성 모델링이 비효율적이라는 문제를 해결하기 위해.
- 깊이 또는 계산 비용을 증가시키지 않으면서도 컨volution 레이어가 전역적 맥락에 접근할 수 있도록 하는 경량의 플러그인 모듈을 설계하기 위해.
- 더 깊은 아키텍처에 비해 모델 크기와 FLOPs를 줄이며 이미지 및 영상 인식 작업의 성능을 향상시키기 위해.
- 두 단계의 주의 메커니즘을 통해 효율적인 전역 특징 집계 및 적응적 분배를 가능하게 하기 위해.
제안 방법
- 더블 어텐션 블록은 두 단계의 주의 메커니즘을 사용한다: 첫 번째로, 두 번째 순서 주의 풀링이 전체 공간 또는 스파티오타임 특징 맵으로부터 핵심 특징을 압축된 표현으로 집계한다.
- 두 번째로, 두 번째 주의 메커니즘이 관련성에 기반하여 풀링된 특징을 각 공간 또는 시간적 위치에 적응적으로 선택하고 분배한다.
- 첫 번째 주의 연산은 특징의 두 번째 순서 통계를 암묵적으로 계산하여 전역 평균 풀링을 넘는 복잡한 외관 및 운동 상관관계를 포착한다.
- 두 번째 주의 메커니즘은 낮은 계산 오버헤드로 각 위치의 특징을 선택적으로 강화하는 적응적 특징 할당을 수행한다.
- 이 블록은 ResNet과 같은 기존 CNN과 호환되는 플러그인 모듈로 설계되었으며, 아키텍처의 대대적인 수정 없이도 어떤 스테이지에나 삽입할 수 있다.
- 비선형 네트워크의 제곱형 복잡도를 피하기 위해, 모든 특징 위치가 아닌 압축된 특징 집합에서 작동함으로써 비용을 절감한다.
실험 결과
연구 질문
- RQ1깊이를 증가시키지 않으면서도 모델 깊이를 증가시키지 않고 장거리 의존성을 효과적으로 모델링할 수 있는 가벼운 학습 가능한 주의 메커니즘이 CNN에 효과적으로 작용할 수 있는가?
- RQ2전역 평균 풀링에 비해 두 번째 순서 특징 풀링이 복잡한 공간적 및 운동 상관관계를 얼마나 잘 포착하는가?
- RQ3두 단계의 주의 메커니즘이 SENet 및 Non-local Networks와 같은 기존 주의 모듈보다 정확도와 효율성 면에서 뛰어나게 성능을 높일 수 있는가?
- RQ4더블 어텐션 블록은 FLOPs와 파라미터를 줄이며 이미지 및 영상 인식 벤치마크에서 성능을 얼마나 향상시킬 수 있는가?
주요 결과
- ImageNet-1k에서 $A^2$-블록을 장착한 ResNet-50은 77.0%의 top-1 정확도를 기록하여 파라미터가 40% 적고 FLOPs가 절반 이하인 ResNet-152(77.0%)를 능가한다.
- Kinetics에서 $A^2$-Net은 단 8장의 입력 프레임과 40.8 GFLOPs로 74.6%의 top-1 정확도를 달성하여 FLOPs와 프레임 수가 더 적은 I3D(71.1%)와 R(2+1)D(72.0%)를 뛰어넘었다.
- UCF-101에서 $A^2$-Net은 41.6 GFLOPs로 96.4%의 top-1 정확도를 기록하여 I3D-RGB(95.6%)와 R(2+1)D-RGB(96.8%)를 정확도 면에서 뛰어나면서도 더 작은 백본과 더 적은 계산량을 사용했다.
- 절단 분석 결과, 더블 어텐션 메커니즘이 기본 ResNet-50 및 SENet에 비해 성능 향상이 뚜렷하게 이루어졌으며, 두 번째 순서 풀링과 적응적 분배의 효과를 입증했다.
- 모델는 강력한 전이 성능을 보이며, Kinetics에서 사전 훈련된 특징을 사용해 UCF-101에서 최고 성능을 기록하여 강력하고 일반화 가능한 특징 학습 능력을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.