[논문 리뷰] A free lunch from ViT:Adaptive Attention Multi-scale Fusion Transformer for Fine-grained Visual Recognition
이 논문은 선택적 주의 집합 모듈(SACM)을 통해 다중 스케일 특징을 적응적으로 융합함으로써 세분화된 시각 인식을 향상시키는 새로운 비전 트랜스포머 기반 모델인 AFTrans를 제안한다. 주의 가중치를 활용해 관련 있는 패치를 동적으로 강조함으로써 AFTrans는 상자 애너테이션 없이도 전반적이고 국소적인 표현을 포착할 수 있으며, CUB-200-2011, Stanford Dogs, iNat2017 벤치마크에서 최신 기술 성능(SOTA)을 달성한다.
Learning subtle representation about object parts plays a vital role in fine-grained visual recognition (FGVR) field. The vision transformer (ViT) achieves promising results on computer vision due to its attention mechanism. Nonetheless, with the fixed size of patches in ViT, the class token in deep layer focuses on the global receptive field and cannot generate multi-granularity features for FGVR. To capture region attention without box annotations and compensate for ViT shortcomings in FGVR, we propose a novel method named Adaptive attention multi-scale Fusion Transformer (AFTrans). The Selective Attention Collection Module (SACM) in our approach leverages attention weights in ViT and filters them adaptively to correspond with the relative importance of input patches. The multiple scales (global and local) pipeline is supervised by our weights sharing encoder and can be easily trained end-to-end. Comprehensive experiments demonstrate that AFTrans can achieve SOTA performance on three published fine-grained benchmarks: CUB-200-2011, Stanford Dogs and iNat2017.
연구 동기 및 목표
- 세분화된 시각 인식을 위한 비전 트랜스포머의 다중 급도 특징을 포착하는 데서 비롯하는 한계를 해결하기 위해.
- 경계 상자 애너테이션을 요구하지 않고도 전역 및 국소 수용 영역의 엔드 투 엔드 학습을 가능하게 하기 위해.
- 다양한 스케일의 주의 맵을 적응적으로 필터링하고 융합하여 특징 표현을 향상시키기 위해.
- 기존 ViT 아키텍처에 원활하게 통합될 수 있는 경량이며 학습 가능한 모듈을 설계하기 위해.
제안 방법
- 선택적 주의 집합 모듈(SACM)은 ViT의 주의 가중치를 적응적으로 필터링하여 상대적 중요도에 따라 중요한 패치를 강조한다.
- SACM을 ViT 인코더의 다양한 레이어에 적용하여 전역 및 국소 스케일을 생성한다.
- 가중치 공유 인코더를 사용하여 다중 스케일 파이프라인을 감독함으로써 최소한의 추가 파rameter로 엔드 투 엔드 학습을 가능하게 한다.
- 기존 아키텍처를 크게 수정하지 않고도 ViT의 자기 주의 메커니즘을 활용하여 계층적 표현을 추출한다.
- 다중 스케일 특징 융합은 구분 능력을 향상시키는 학습 가능한 주의 기반 집합 메커니즘을 통해 수행된다.
- 표준 교차 엔트로피 손실을 사용하여 표준 세분화된 벤치마크에서 모델을 엔드 투 엔드로 학습시킨다.
실험 결과
연구 질문
- RQ1적응적인 주의 메커니즘은 세분화된 시각 인식을 위한 비전 트랜스포머의 특징 표현을 향상시킬 수 있는가?
- RQ2경계 상자 애너테이션에 의존하지 않고 다중 스케일 특징을 효과적으로 융합할 수 있는가?
- RQ3비전 트랜스포머가 동시에 국소적 및 전역적 맥락을 포착할 수 있도록 경량 모듈을 설계할 수 있는가?
- RQ4제안된 방법은 표준 세분화된 벤치마크에서 최신 기술 성능을 달성하는가?
주요 결과
- AFTrans는 경계 상자 애너테이션을 사용하지 않고도 CUB-200-2011 벤치마크에서 최신 기술 성능을 달성한다.
- Stanford Dogs 데이터셋에서 AFTrans는 기존의 트랜스포머 기반 모델보다 상당한 격차로 상위-1 정확도를 초월한다.
- iNat2017 벤치마크에서 AFTrans는 다양한 세분화된 카테고리에 걸쳐 경쟁적인 성능을 보이며 일반화 능력을 입증한다.
- 제거 실험을 통해 SACM 모듈과 다중 스케일 융합이 성능 향상에 크게 기여함을 확인하여 설계 선택의 타당성을 입증한다.
- 이러한 결과는 최소한의 아키텍처 수정과 추가 감독 없이 달성되었으며, 이는 효율성과 효과성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.