[논문 리뷰] PSViT: Better Vision Transformer via Token Pooling and Attention Sharing
PSViT는 유연한 토큰 풀링과 어텐션 공유를 도입하여 공간적 및 계층 간 부복을 줄여 더 나은 특징 표현과 뛰어난 속도-정확도 트레이드오프를 가능하게 함. 압축된 검색 공간과 AutoML(SPOS)을 사용하여 ImageNet에서 DeiT 대비 최대 6.6%의 상위-1 정확도 향상을 달성하고, 하류 검출 및 세그멘테이션 작업에서 ResNets를 능가함.
In this paper, we observe two levels of redundancies when applying vision transformers (ViT) for image recognition. First, fixing the number of tokens through the whole network produces redundant features at the spatial level. Second, the attention maps among different transformer layers are redundant. Based on the observations above, we propose a PSViT: a ViT with token Pooling and attention Sharing to reduce the redundancy, effectively enhancing the feature representation ability, and achieving a better speed-accuracy trade-off. Specifically, in our PSViT, token pooling can be defined as the operation that decreases the number of tokens at the spatial level. Besides, attention sharing will be built between the neighboring transformer layers for reusing the attention maps having a strong correlation among adjacent layers. Then, a compact set of the possible combinations for different token pooling and attention sharing mechanisms are constructed. Based on the proposed compact set, the number of tokens in each layer and the choices of layers sharing attention can be treated as hyper-parameters that are learned from data automatically. Experimental results show that the proposed scheme can achieve up to 6.6% accuracy improvement in ImageNet classification compared with the DeiT.
연구 동기 및 목표
- 모든 계층에서 고정된 토큰 수로 인해 발생하는 비전 트랜스포머의 공간적 부복을 해결하기 위해.
- 연속된 계층에서 유사한 어텐션 패턴으로 인해 발생하는 계층 간 어텐션 맵 부복을 줄이기 위해.
- 최적의 토큰 수와 어텐션 공유 구성 설정을 학습함으로써 유연한 계산 자원 할당을 가능하게 하기 위해.
- 비전 트랜스포머 아키텍처에서 더 나은 특징 표현과 더 나은 속도-정확도 트레이드오프를 달성하기 위해.
- AutoML를 활용한 데이터 기반 원리적인 ViT 아키텍처 설계 방법을 개발하기 위해.
제안 방법
- 특징 복잡도에 맞게 다양한 네트워크 스테이지에서 토큰 수를 동적으로 감소시키는 토큰 풀링 메커니즘을 도입함.
- 유사한 어텐션 맵을 재사용함으로써 계산량을 줄이기 위해 인접한 트랜스포머 계층 간 어텐션 공유를 적용함.
- 토큰 풀링 위치와 어텐션 공유 선택을 하이퍼파라미터로 조합하여 압축된 검색 공간을 구성함.
- 단일 경로 일시적(SPOS)을 사용하여 신경망 아키텍처 탐색을 수행하여 토큰 수와 어텐션 공유 패턴을 동시에 최적화함.
- 토큰 풀링과 어텐션 공유를 미분 가능한 아키텍처 탐색을 통해 엔드 투 엔드로 학습 가능한 하이퍼파라미터로 간주함.
- 1D 및 2D 토큰 풀링 변형을 사용하며, 2D 풀링이 이미지 작업에서 공간 구조를 더 잘 유지함.
실험 결과
연구 질문
- RQ1계층 간 동적 토큰 풀링이 비전 트랜스포머의 특징 표현을 향상시킬 수 있는가?
- RQ2인접한 ViT 계층의 어텐션 맵에서 얼마나 많은 부복이 발생하는가? 이를 활용할 수 있는가?
- RQ3토큰 풀링과 어텐션 공유를 위한 압축된 검색 공간이 효과적인 AutoML 기반 아키텍처 탐색을 가능하게 하는가?
- RQ4토큰 수와 어텐션 공유를 동시에 최적화하면 더 나은 정확도 및 효율성 트레이드오프를 달성할 수 있는가?
- RQ5PSViT는 객체 검출 및 인스턴스 세그멘테이션과 같은 하류 비전 작업으로 얼마나 잘 전이되는가?
주요 결과
- PSViT는 DeiT 대비 ImageNet에서 최대 6.6% 높은 상위-1 정확도를 달성하여 뚜렷한 성능 향상을 보임.
- PSViT-2D-Tiny는 COCO 객체 검출에서 40.8% mAP, 인스턴스 세그멘테이션에서 37.7% mAP를 기록하여 ResNet18은 물론 ResNet101를 초월함.
- 2D 토큰 풀링 변형이 1D 버전보다 우수한 성능을 보이며, 공간 구조를 유지함으로써 특징 품질 향상이 가능함을 시사함.
- 마지막 트랜스포머 계층은 독립적인 자기 어텐션의 이점을 가장 많이 얻기 때문에 어텐션 공유를 피함.
- 초기 스테이지에서는 높은 계산 비용과 특징의 스무딩 특성으로 인해 어텐션 공유에서 가장 큰 이점을 얻음.
- 검색 공간 설계가 효과적인 AutoML 최적화를 가능하게 하여, PSViT-2D-Tiny는 최소한의 인간 간섭으로도 뛰어난 성능을 달성함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.