[논문 리뷰] Three things everyone should know about Vision Transformers
이 논문은 비전 트랜스포머를 위한 세 가지 실용적인 개선 사항을 제안한다: (1) 정확도 손실 없이 훈련 효율성을 향상시키고 지연을 줄이기 위해 잔차 블록을 병렬화하는 것; (2) 해상도 적응 및 전이 학습을 위해 어텐션 레이어만 미세조정하여 계산 및 메모리 사용을 절감하는 것; (3) 마스크 기반 자기지도 학습에서 효과적인 패치 사전 처리를 가능하게 하는 계층적 MLP 스템을 도입하여 BeiT 및 감독 학습 벤치마크에서 성능을 향상시키는 것.
After their initial success in natural language processing, transformer architectures have rapidly gained traction in computer vision, providing state-of-the-art results for tasks such as image classification, detection, segmentation, and video analysis. We offer three insights based on simple and easy to implement variants of vision transformers. (1) The residual layers of vision transformers, which are usually processed sequentially, can to some extent be processed efficiently in parallel without noticeably affecting the accuracy. (2) Fine-tuning the weights of the attention layers is sufficient to adapt vision transformers to a higher resolution and to other classification tasks. This saves compute, reduces the peak memory consumption at fine-tuning time, and allows sharing the majority of weights across tasks. (3) Adding MLP-based patch pre-processing layers improves Bert-like self-supervised training based on patch masking. We evaluate the impact of these design choices using the ImageNet-1k dataset, and confirm our findings on the ImageNet-v2 test set. Transfer performance is measured across six smaller datasets.
연구 동기 및 목표
- 정확도를 희생시키지 않고 비전 트랜스포머의 훈련 효율성과 추론 지연을 향상시키는 아키텍처 수정을 탐색하는 것.
- ViT를 더 높은 해상도 또는 새로운 분류 작업에 적응시키기 위해 어텐션 레이어만 미세조정하는 것이 충분한 성능을 유지할 수 있는지 조사하는 것.
- 마스크 기반 자기지도 학습 방법(예: BeiT)과 호환되며, 성능을 향상시키는 패치 사전 처리 스템을 설계하는 것.
- 이러한 설계 선택 사항이 ImageNet-1k, ImageNet-v2 및 6개의 더 작은 데이터셋에서의 전이 학습을 포함한 여러 벤치마크에서 미치는 영향을 평가하는 것.
제안 방법
- 다중 헤드 어텐션(MHSA)과 피드포워드 네트워크(FFN) 블록을 쌍으로 재구성하여 병렬화된 아키텍처를 제안함으로써, 동일한 FLOPS와 파라미터를 유지하면서도 더 넓고 얕은 네트워크를 구현함.
- FFN 레이어를 동 冻결하고 새로운 해상도 또는 다운스트림 작업에 적응할 때 어텐션 가중치만 업데이트하는 미세조정 전략을 도입함.
- 다중 선형 레이어와 비선형성, 패치 집합을 적용하는 계층적 MLP(hMLP) 스템을 설계하여 패치 간 통신 없이도 마스크 적용을 유지함.
- hMLP 스템을 ViT 인코더 이전에 적용하고, 사전 처리 후 마스크를 적용함으로써 BeiT와 같은 마스크 자동에코딩 방법과의 호환성을 확보함.
- 표준 훈련 프로토콜을 사용함: 감독 학습을 위한 300 에포크, 전이 작업을 위한 100 에포크 미세조정, LayerScale 및 표준 데이터 증강을 적용함.
- 일관된 초모수와 난수 시드를 사용하여 ImageNet-1k 및 전이 벤치마크에서 선형, 배치 정규화, 컨볼루션, hMLP를 포함한 여러 스템 설계 간 성능을 비교함.
실험 결과
연구 질문
- RQ1비전 트랜스포머의 잔차 블록을 병렬화하면 정확도 저하 없이 훈련 효율성과 추론 지연을 향상시킬 수 있는가?
- RQ2ViT의 어텐션 레이어만 미세조정하는 것이 해상도 적응 또는 전이 학습에서 경쟁적인 성능을 유지하는 데 충분한가?
- RQ3마스크 기반 자기지도 학습(예: BeiT)과 호환되면서 성능을 향상시킬 수 있는 패치 사전 처리 스템을 설계할 수 있는가?
- RQ4기존의 컨볼루션 및 선형 스템과 비교해 볼 때, 제안된 hMLP 스템은 감독 학습 및 자기지도 학습 환경에서 정확도, FLOPS, 일반화 능력 측면에서 어떻게 비교되는가?
주요 결과
- ViT 블록을 병렬화하면 GPU에서 작은 배치 크기일 경우 최적화가 향상되고 지연이 감소하며, 정확도는 유지되거나 약간 향상됨.
- 해상도나 새로운 분류 작업에 적응시키기 위해 FFN 레이어를 동 冻결하고 어텐션 가중치만 업데이트하는 전략은 전체 미세조정과 비교해 유사한 정확도를 달성함으로써 계산 및 메모리 사용을 줄임.
- hMLP 스템은 BeiT 사전 훈련 하에서 ImageNet-v2에서 +0.38%, ImageNet-val에서 +0.39%의 상위-1 정확도 향상을 기록하여 선형 및 컨볼루션 스템을 모두 초월함.
- hMLP 스템은 감독 학습에서 최고의 컨볼루션 스템(LeViT)과 유사한 성능을 달성하면서도 FLOPS를 1.15배 줄이고 패치 간 통신을 방지함.
- 기존의 컨볼루션 스템은 마스크 적용과 간섭하여 BeiT 사전 훈련에서 성능 향상을 이룰 수 없었지만, hMLP 스템은 패치 사전 처리와 마스크 예측을 모두 효과적으로 활용함.
- ViT-B12 대비 hMLP 스템은 FLOPS를 오직 0.8%만 증가시켰지만, 자기지도 학습 및 전이 학습 환경에서 뚜렷한 정확도 향상을 이룸.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.