[논문 리뷰] Vision Transformer: Vit and its Derivatives
이 논문은 비전 트랜스포머(ViT) 및 주요 파생 모델인 PVT, Swin Transformer, MLP-Mixer, XCiT, MViT, TimesFormer, SegFormer, UNETR를 종합적으로 검토하며, 자기주의(self-attention) 메커니즘과 아키텍처 혁신이 이미지 분류, 객체 검출, 세분화, 비디오 인식, 의료 영상 등 다양한 분야에서 최신 성능을 달성하는 데 기여함을 보여준다. 핵심 기여는 ViT 기반 모델이 스케일링, 대규모 사전학습, 국소주의, 효율적 주의, MLP 기반 혼합과 같은 아키텍처 수정을 통해 특히 뛰어난 정확도와 일반화 능력을 확보함을 입증한 데 있다.
Transformer, an attention-based encoder-decoder architecture, has not only revolutionized the field of natural language processing (NLP), but has also done some pioneering work in the field of computer vision (CV). Compared to convolutional neural networks (CNNs), the Vision Transformer (ViT) relies on excellent modeling capabilities to achieve very good performance on several benchmarks such as ImageNet, COCO, and ADE20k. ViT is inspired by the self-attention mechanism in natural language processing, where word embeddings are replaced with patch embeddings. This paper reviews the derivatives of ViT and the cross-applications of ViT with other fields.
연구 동기 및 목표
- 비전 트랜스포머(ViT)의 진화와 컴퓨터 비전 작업 전반에 걸친 아키텍처 혁신을 조사하기 위해.
- 자기주의 메커니즘의 수정이 고밀도 예측 및 고해상도 작업에서 효율성과 성능을 향상시키는 방식을 분석하기 위해.
- 모델 크기와 사전학습 데이터의 스케일링이 소수의 샘플에서의 일반화 능력과 정확도에 미치는 영향을 평가하기 위해.
- 비디오 인식, 세분화, 3D 의료 영상 세분화와 같은 분야에서 ViT의 교차 분야 적용을 탐색하기 위해.
- 국소주의, MLP 기반 혼합, 위치 인코딩 제거와 같은 아키텍처 원칙이 ViT 성능을 향상시키는 방식을 규명하기 위해.
제안 방법
- 피라미드 비전 트랜스포머(PVT)를 제안하여 공간 감소 주의(SRA)를 도입함으로써 키와 값의 다운샘플링을 통해 이차적 주의 복잡도를 감소시켜 계층적 특징 학습을 가능하게 함.
- PVT-v2를 도입하여 겹치는 패치 임베딩, 깊이 분리형 컨볼루션 피드포워드 네트워크, 선형 복잡도의 자기주의를 통해 국소 인덕티브 바이어스를 향상시키고 다양한 이미지 해상도에서의 유연성을 확보함.
- 이동된 창 분할 기법을 사용해 국소 자기주의를 구현하고 선형 복잡도 O(M×N)를 달성함으로써 계층적 표현 학습과 글로벌 컨텍스트 모델링이 가능한 스위프트 트랜스포머를 개발함.
- ViT에 스케일링 법칙을 적용하여 30억 장의 이미지에서 20억 파라미터 모델을 훈련함으로써 소수의 샘플에서의 정확도가 향상됨(Imagenet에서 상위 1위 정확도 84.86%)을 입증함.
- MLP-Mixer에서 자기주의를 두 개의 MLP로 대체함: 하나는 패치 간 채널 혼합을 위해, 다른 하나는 공간 위치 간 토큰 혼합을 위해.
- XCiT는 교차 공분산 주의(XCA)를 도입하여 깊이 분리형 및 포인트 와이드 컨볼루션을 사용해 토큰과 채널 혼합을 분리함으로써 파rameter 수를 줄이고 효율적인 비국소 주의를 실현함.
실험 결과
연구 질문
- RQ1ViT의 자기주의 메커니즘은 고해상도 및 고밀도 예측 작업에서 어떻게 더 효율적으로 만들 수 있는가?
- RQ2어떤 아키텍처 수정이 객체 검출 및 세분화 작업에서 CNN과 경쟁 가능한 성능을 내는 ViT를 가능하게 하는가?
- RQ3모델 크기와 사전학습 데이터의 스케일링이 ViT 기반 모델의 소수의 샘플에서의 일반화 능력에 얼마나 큰 영향을 미치는가?
- RQ4성능을 저하시키지 않고 자기주의를 MLP 기반 또는 컨볼루션 기반 혼합 메커니즘으로 효과적으로 대체할 수 있는가?
- RQ5위치 인코딩, 풀링, 정규화와 같은 아키텍처 선택이 다양한 입력 해상도에서 ViT의 강건성에 어떻게 영향을 미치는가?
주요 결과
- 스위프트 트랜스포머는 이동된 창 분할 기법을 통해 선형 복잡도 O(M×N)를 달성하여 효율적인 국소 자기주의와 계층적 특징 학습이 가능함.
- PVT-v2는 겹치는 패치와 깊이 분리형 컨볼루션을 통해 국소 인덕티브 바이어스를 향상시켜 세분화 및 객체 검출 작업에서 더 뛰어난 성능을 달성함.
- ViT를 20억 파라미터로 확장하고 30억 장의 이미지에서 사전학습하면 ImageNet에서 상위 1위 정확도 90.45%와 소수의 샘플에서 정확도 84.86%를 기록하여 제한된 데이터에서 강력한 일반화 능력을 입증함.
- 헤드 레이어와 본문 레이어의 가중치 감쇠를 분리하면 소수의 샘플 성능이 향상되며, 특히 헤드에 더 강한 감쇠를 적용할 경우 클래스 간 분리가 향상됨.
- MLP-Mixer와 XCiT는 자기주의를 두 단계의 MLP 또는 컨볼루션 기반 혼합으로 대체함으로써 계산 비용을 줄이고도 정확도를 유지하면서 경쟁 가능한 성능을 달성함.
- SegFormer는 위치 인코딩을 사용하지 않는 계층적 인코더와 단순한 MLP 디코더를 사용함으로써 해상도 변화에 강건한 성능을 내며, 세분화 분야에서 최신 성능 기록을 달성함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.