[논문 리뷰] ReViT: Enhancing Vision Transformers Feature Diversity with Attention Residual Connections
ReViT는 주어진 시각적 특징을 유지하기 위해 주어진 주의 흐름을 통해 저수준의 시각적 특징을 보존하는 잔차 주의 메커니즘을 제안한다. 이는 깊이 있는 레이어에서의 특징 붕괴를 완화한다. 이 방법은 국소적 및 전역적 주의를 균형 있게 조절함으로써 이미지 분류 및 객체 검출 벤치마크 전반에서 성능을 향상시키며, ImageNet1k, CIFAR100 및 COCO2017에서 최신 기술 수준의 성능을 달성한다.
Vision Transformer (ViT) self-attention mechanism is characterized by feature collapse in deeper layers, resulting in the vanishing of low-level visual features. However, such features can be helpful to accurately represent and identify elements within an image and increase the accuracy and robustness of vision-based recognition systems. Following this rationale, we propose a novel residual attention learning method for improving ViT-based architectures, increasing their visual feature diversity and model robustness. In this way, the proposed network can capture and preserve significant low-level features, providing more details about the elements within the scene being analyzed. The effectiveness and robustness of the presented method are evaluated on five image classification benchmarks, including ImageNet1k, CIFAR10, CIFAR100, Oxford Flowers-102, and Oxford-IIIT Pet, achieving improved performances. Additionally, experiments on the COCO2017 dataset show that the devised approach discovers and incorporates semantic and spatial relationships for object detection and instance segmentation when implemented into spatial-aware transformer models.
연구 동기 및 목표
- 자기 주의의 과도한 전역화로 인해 저수준의 시각적 특징이 손실되는 깊이 있는 비전 트랜스포머에서의 특징 붕괴 문제를 해결하기 위해.
- 다중 헤드 자기 주의 레이어 전반에 걸쳐 잔차 주의 연결을 통합하여 모델의 강건성과 특징 다양성을 향상시키기 위해.
- 국소적 및 의미적 세부 정보를 보존함으로써 이미지 분류 및 객체 검출과 같은 시각 인식 작업의 성능을 향상시키기 위해.
- 다양한 복잡도와 클래스 분포를 가진 다양한 데이터셋에서 잔차 주의 메커니즘의 효과성을 평가하기 위해.
제안 방법
- 학습 중에 학습 가능한 게이팅 변수 α를 통해 현재와 과거의 자기 주의 출력을 결합하는 잔차 주의 학습 메커니즘을 도입한다.
- 다중 헤드 자기 주의(MHSA) 레이어에서 쿼리 및 키 행렬에 잔차 연결을 적용하여 浅층에서의 특징 전파를 가능하게 한다.
- 과거 및 현재 주의 맵의 가중치 합성: α × (과거 주의) + (1−α) × (현재 주의)이며, α는 학습 중에 학습된다.
- GradCAM 시각화를 통해 ReViT가 표준 ViT보다 더 국소적이고 다양한 특징을 보존함을 입증한다.
- 객체 검출 및 COCO2017에서의 인스턴스 세그멘테이션을 위해 표준 및 공간 인식 트랜스포머 아키텍처 양쪽에 잔차 모듈을 적용한다.
- α 값의 다양한 설정을 통해 국소적 및 전역적 특징 학습 간의 트레이드오프를 분석하기 위한 아블레이션 스터디를 수행한다.
![Figure 1: Illustration of feature maps learned from ReViT and ViT obtained using GradCAM [ 31 ] algorithm.](https://ar5iv.labs.arxiv.org/html/2402.11301/assets/x1.png)
실험 결과
연구 질문
- RQ1잔차 주의 학습은 비전 트랜스포머에서 특징 다양성과 표현 품질에 어떤 영향을 미치는가?
- RQ2성능을 최대화하기 위해 과거와 현재 주의 정보 사이의 최적의 균형(α를 통해)은 무엇인가?
- RQ3ReViT는 ImageNet1k, CIFAR10 및 CIFAR100과 같은 이미지 분류 벤치마크에서 성능을 얼마나 향상시키는가?
- RQ4공간 인식 트랜스포머 모델에서 의미적 및 공간적 관계를 포착함으로써 ReViT는 객체 검출 및 인스턴스 세그멘테이션을 향상시킬 수 있는가?
- RQ5객체 위치 변화에 대한 강건성과 인덕티브 바이어스 제한 사항 측면에서 ReViT는 표준 ViT보다 어떻게 비교되는가?
주요 결과
- ReViT는 ImageNet1k에서 최신 기술 수준의 성능을 달성하며, 표준 ViT 및 기타 최신 모델보다 정확도와 강건성 면에서 뛰어나다.
- CIFAR100 및 Oxford Flowers-102에서 ReViT는 α = 0.75에서 최고 성능를 기록하며, α가 1에 가까워질수록 정확도가 급격히 감소함을 확인하여 과거 주의의 중요성을 입증한다.
- Oxford-IIIT Pet 데이터셋에서는 α가 최적으로 조정되었을 때 내부 클래스 및 외부 클래스 변동을 더 잘 다루기 때문에 성능 향상이 두드러진다.
- COCO2017에서 ReViT는 공간 인식 트랜스포머에서 의미적 및 공간적 관계를 발견하고 통합함으로써 객체 검출 및 인스턴스 세그멘테이션 성능을 향상시킨다.
- 아블레이션 스터디는 α = 0(첫 번째 레이어 주의에만 의존)일 경우 성능 붕괴가 발생하며, 특히 복잡한 데이터셋에서 두드러짐을 확인하여 잔차 주의의 필요성을 강조한다.
- GradCAM 시각화 결과 ReViT가 표준 ViT보다 더 국소적이고 다양한 특징을 보존함을 확인하였으며, 특히 깊이 있는 레이어에서 특징 붕괴를 줄였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.