[논문 리뷰] SG-Former: Self-guided Transformer with Evolving Token Reallocation
SG-Former는 자기 지도형 트랜스포머를 도입하여 변화하는 토큰 재할당 기법을 통해 더 많은 토큰을 중요한 이미지 영역에 할당하여 세밀한 주의를 가능하게 하면서도 덜 중요한 영역에서는 토큰을 줄여 전반적인 맥락과 효율성을 유지한다. 하이브리드 스케일 자기주의 주의에서 유도된 중요도 맵이 학습 도중 변화함에 따라, 더 낮은 FLOPs와 더 적은 파라미터로 최신 기술 수준의 성능을 달성하며, ImageNet-1K에서 84.7%의 Top-1 정확도를 기록하고 Swin Transformer를 +1.3% 정확도 및 +3 mIoU 높이면서 ADE20K에서 슈퍼어리어를 초월한다.
Vision Transformer has demonstrated impressive success across various vision tasks. However, its heavy computation cost, which grows quadratically with respect to the token sequence length, largely limits its power in handling large feature maps. To alleviate the computation cost, previous works rely on either fine-grained self-attentions restricted to local small regions, or global self-attentions but to shorten the sequence length resulting in coarse granularity. In this paper, we propose a novel model, termed as Self-guided Transformer~(SG-Former), towards effective global self-attention with adaptive fine granularity. At the heart of our approach is to utilize a significance map, which is estimated through hybrid-scale self-attention and evolves itself during training, to reallocate tokens based on the significance of each region. Intuitively, we assign more tokens to the salient regions for achieving fine-grained attention, while allocating fewer tokens to the minor regions in exchange for efficiency and global receptive fields. The proposed SG-Former achieves performance superior to state of the art: our base size model achieves extbf{84.7\%} Top-1 accuracy on ImageNet-1K, extbf{51.2mAP} bbAP on CoCo, extbf{52.7mIoU} on ADE20K surpassing the Swin Transformer by extbf{+1.3\% / +2.7 mAP/ +3 mIoU}, with lower computation costs and fewer parameters. The code is available at \href{https://github.com/OliverRensu/SG-Former}{https://github.com/OliverRensu/SG-Former}
연구 동기 및 목표
- 고해상도 특징 맵에서 비전 트랜스포머의 제곱형 계산 비용을 해결하기 위해.
- 전역 수용역을 훼손하거나 계산 비용을 증가시키지 않고 세밀한 전역 자기주의 주의를 가능하게 하기 위해.
- 영역 중요도에 따라 토큰을 동적으로 재할당하여 중요 영역에서 표현 품질을 향상시키기 위해.
- 수동으로 설계된 토큰 집약 전략에 대한 의존도를 줄이기 위해 종단 간 중요도 맵을 학습함으로써.
- 단일 자기주의 주의 메커니즘 내에서 국소적 및 전역적 주의를 통합하여 적응형 해상도를 가능하게 하기 위해.
제안 방법
- 모델은 단일 레이어 내에서 다중 해상도 특징을 추출하기 위해 하이브리드 스케일 자기주의 주의를 사용하며, 주의 헤드를 그룹화하여 국소적 및 전역적 패턴을 모두 포착한다.
- 하이브리드 스케일 주의 출력에서 중요도 맵을 추정하여 중요도 기반으로 중요한 이미지 영역을 식별한다.
- 중요도 맵에 따라 토큰을 재할당한다: 중요 영역에는 더 많은 토큰을 할당하여 세밀한 상호작용을 가능하게 하고, 배경 영역에는 더 적은 토큰을 할당하여 효율성을 확보한다.
- 중요도 맵은 학습 도중 변화함에 따라 자기 지도형, 적응형 재할당이 가능해지며, 이는 이미지에 특화되고 데이터 기반이다.
- 키 및 밸류 토큰은 재할당되지만 쿼리 토큰은 고정되어 있어 동적 토큰 분포를 통해 효율적인 전역 자기주의 주의를 가능하게 한다.
- 전체 특징 맵을 통한 장거리 의존성을 유지하면서도, 의미적으로 중요한 영역에 계산 자원을 집중시킨다.
실험 결과
연구 질문
- RQ1자기주의 주의 메커니즘이 중요한 영역에 토큰을 동적으로 재할당하여 전역 맥락을 유지하면서 세밀한 표현을 향상시킬 수 있는가?
- RQ2하이브리드 스케일 주의는 토큰 재할당을 위한 더 정확한 중요도 맵 추정에 어떻게 기여하는가?
- RQ3자기 지도형, 변화하는 토큰 재할당 전략은 정확도와 효율성 측면에서 고정 또는 균일한 토큰 집약 전략을 능가하는가?
- RQ4적응형 토큰 할당은 계산 비용을 줄이면서도 고해상도 특징 맵에서 전역 수용역을 유지할 수 있는가?
- RQ5지역, 전역 또는 하이브리드 스케일 주의에서 유도된 중요도 맵을 사용할 경우 모델 성능에 어떤 영향을 미치는가?
주요 결과
- SG-Former는 ImageNet-1K에서 84.7%의 Top-1 정확도를 달성하여 Swin Transformer를 +1.3% 높이었다.
- COCO 객체 검출에서 51.2 mAP bbAP를 기록하여 Swin Transformer를 +2.7 mAP 높였다.
- ADE20K 세분화에서 52.7 mIoU를 달성하여 Swin Transformer를 +3 mIoU 높였다.
- 베이스 모델을 사용할 경우, 성능 향상과 함께 Swin Transformer보다 FLOPs와 파라미터를 줄였다.
- 제거 분석 결과, 하이브리드 스케일 중요도 맵이 국소, 전역 또는 수동으로 정의된 맵보다 +0.9 Top-1 정확도로 우수했다.
- 세분화 FPN를 사용할 경우, SG-Former는 ADE20K에서 50.6 mIoU를 기록하여 Swin보다 4.6 mIoU 높였고 파라미터 수는 10% 적게 사용했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.