[논문 리뷰] Searching for Efficient Multi-Stage Vision Transformers
이 논문은 ViT-ResNAS를 제안하며, 다단계 비전 트랜스포머 아키텍처로서 공간 감소를 통한 잔차 연결을 통합하여 시퀀스 길이를 줄이고 단계 간 특징 차원을 증가시키며, 다중 아키텍처 샘플링을 사용하는 새로운 가중치 공유 NAS 방법을 결합한다. 이 방법은 DeiT, PVT, PiT 기준선보다 훨씬 낮은 FLOPs와 더 높은 처리량을 기록하면서 ImageNet에서 최신 기술 수준의 정확도-MACs 및 정확도-처리량 트레이드오프를 달성한다.
Vision Transformer (ViT) demonstrates that Transformer for natural language processing can be applied to computer vision tasks and result in comparable performance to convolutional neural networks (CNN), which have been studied and adopted in computer vision for years. This naturally raises the question of how the performance of ViT can be advanced with design techniques of CNN. To this end, we propose to incorporate two techniques and present ViT-ResNAS, an efficient multi-stage ViT architecture designed with neural architecture search (NAS). First, we propose residual spatial reduction to decrease sequence lengths for deeper layers and utilize a multi-stage architecture. When reducing lengths, we add skip connections to improve performance and stabilize training deeper networks. Second, we propose weight-sharing NAS with multi-architectural sampling. We enlarge a network and utilize its sub-networks to define a search space. A super-network covering all sub-networks is then trained for fast evaluation of their performance. To efficiently train the super-network, we propose to sample and train multiple sub-networks with one forward-backward pass. After that, evolutionary search is performed to discover high-performance network architectures. Experiments on ImageNet demonstrate that ViT-ResNAS achieves better accuracy-MACs and accuracy-throughput trade-offs than the original DeiT and other strong baselines of ViT. Code is available at https://github.com/yilunliao/vit-search.
연구 동기 및 목표
- 컨volutional 네트워크(CNNs)의 설계 원칙, 특히 공간 감소와 다단계 아키텍처를 비전 트랜스포머(ViTs)에 통합하여 효율성과 성능을 향상시키기.
- 깊은 ViT 모델에서 높은 계산 비용과 학습 불안정성 문제를 해결하기 위해 공간 감소 과정에 잔차 연결을 도입하기.
- 다단계 ViT에 특화된 더 효율적인 신경망 아키텍처 탐색(NAS) 프레임워크를 개발하여 신속하고 정확한 아키텍처 탐색을 가능하게 하기.
- DeiT, PVT, PiT와 같은 기존 ViT 모델보다 ImageNet 벤치마크에서 더 나은 정확도-계산 트레이드오프를 달성하기.
제안 방법
- 잔차 공간 감소를 제안: 각 단계에서 공간 해상도를 감소시키고 채널 수를 증가시키며, 학습 안정성과 성능 향상을 위해 스킵 연결을 통합한 다단계 ViT 설계.
- 초망신경망 기반의 NAS 프레임워크를 도입하며, 다중 아키텍처 샘플링을 통해 단일 순전파-역전파 프로세스에서 여러 하위망신경망을 샘플링하고 학습하여 초망신경망 학습을 가속화.
- 기본 ViT-Res 아키텍처를 깊이와 너비 측면에서 확장하여 검색 공간을 구성함으로써 다양한 하위망신경망을 효율적으로 탐색할 수 있도록 함.
- 학습된 초망신경망에서 유전적 탐색을 수행하여 재학습 없이 고성능 아키텍처를 탐색.
- 검색 공간 내 모든 하위망신경망 간에 가중치 공유를 구현하여 개별 학습 없이도 초망신경망의 가중치를 통해 성능를 추정할 수 있도록 함.
- 아키텍처의 배치 독립적 성질을 활용하여 NAS 파이프라인 내 학습 효율성과 탐색 품질을 향상시킴.
실험 결과
연구 질문
- RQ1CNN과 유사한 다단계 아키텍처를 구현하기 위해 잔차 공간 감소를 통해 비전 트랜스포머의 정확도와 효율성을 향상시킬 수 있는가?
- RQ2낮은 계산 비용으로 다단계 비전 트랜스포머에 대해 더 효율적이고 효과적인 신경망 아키텍처 탐색을 어떻게 수행할 수 있는가?
- RQ3다중 아키텍처 샘플링을 통한 가중치 공유 NAS는 표준 NAS 방법보다 고성능 ViT 아키텍처 탐색에서 뛰어난 성능을 내는가?
- RQ4제안된 방법은 최신 기술 수준의 ViT 모델 대비 정확도-MACs 및 정확도-처리량 트레이드오프를 어느 정도 향상시키는가?
- RQ5공간 감소 과정에 잔차 연결을 통합함으로써 깊은 ViT 모델에서 학습 안정성과 성능 향상이 이루어지는가?
주요 결과
- ViT-ResNAS-Tiny는 DeiT-Tiny보다 8.6% 높은 정확도를 기록하면서도 MACs는 0.5G만 더 사용하고 처리량은 약간 낮게 유지한다.
- ViT-ResNAS-Small는 단일 Titan RTX GPU에서 DeiT-Base와 동일한 정확도를 달성하면서 MACs는 6.3배 줄이고 처리량은 3.7배 높였다.
- PiT-S 대비 ViT-ResNAS-Tiny는 유사한 정확도를 기록하면서 MACs는 1.6배 줄이고 처리량은 1.6배 높였다.
- ViT-ResNAS-Medium는 PiT-B보다 0.4% 높은 정확도를 기록하면서 MACs는 2.8배 줄이고 처리량은 2.4배 높였다.
- 낮은 MAC 영역(~2.0G)에서는 ViT-ResNAS-Tiny가 ViL-Tiny보다 정확도-MACs 트레이드오프에서 뛰어난 성능을 보였고, 높은 MAC 영역(~5.0G)에서는 ViL-Small의 성능을 따라했다.
- 제안된 다중 아키텍처 샘플링을 통한 가중치 공유 NAS는 초망신경망 학습을 더 빠르게 하고, 표준 NAS 접근 방식보다 성능이 뛰어난 아키텍처를 도출한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.