[논문 리뷰] BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers
BEiT v2는 지식 증류로 학습된 벡터 양자화 시각 토크나이저를 통해 마스킹된 이미지 모델링의 의미적 타깃을 제공하고, 패치 집계 전략으로 글로벌 표현을 강화한다; ImageNet 분류 및 ADE20K 분할에서 최첨단 성능을 달성한다.
Masked image modeling (MIM) has demonstrated impressive results in self-supervised representation learning by recovering corrupted image patches. However, most existing studies operate on low-level image pixels, which hinders the exploitation of high-level semantics for representation models. In this work, we propose to use a semantic-rich visual tokenizer as the reconstruction target for masked prediction, providing a systematic way to promote MIM from pixel-level to semantic-level. Specifically, we propose vector-quantized knowledge distillation to train the tokenizer, which discretizes a continuous semantic space to compact codes. We then pretrain vision Transformers by predicting the original visual tokens for the masked image patches. Furthermore, we introduce a patch aggregation strategy which associates discrete image patches to enhance global semantic representation. Experiments on image classification and semantic segmentation show that BEiT v2 outperforms all compared MIM methods. On ImageNet-1K (224 size), the base-size BEiT v2 achieves 85.5% top-1 accuracy for fine-tuning and 80.1% top-1 accuracy for linear probing. The large-size BEiT v2 obtains 87.3% top-1 accuracy for ImageNet-1K (224 size) fine-tuning, and 56.7% mIoU on ADE20K for semantic segmentation. The code and pretrained models are available at https://aka.ms/beitv2.
연구 동기 및 목표
- 의미적 시각 토크나이저를 사용하여 픽셀 수준에서 의미 수준으로 마스킹된 이미지 모델링을 촉진한다.
- 학습 가능한 코드북으로 의미 공간을 양자화하기 위해 VQ-KD 토크나이저를 학습한다.
- 전역 표현을 개선하기 위한 패치 집계 전략으로 BEiT 사전학습을 강화한다.
- ImageNet 분류(정밀조정 및 선형 탐침) 및 ADE20K 의미 분할에서 BEiT v2를 경험적으로 검증한다.
- 모델 크기 및 사전학습 일정 전반에 걸친 강건성과 전이 가능성을 입증한다.
제안 방법
- 이미지에 맵핑된 패치 특성에서 벡터 양자화 지식 증류(VQ-KD)를 사용하는 시각 토크나이저를 학습한다. 여기서 ViT 인코더가 이미지를 패치 특징으로 매핑하고, 코드북이 가장 가까운 코드를 선택하며, 디코더가 코사인 유사도를 감독으로 사용해 티처 특징 재구성을 학습한다.
- VQ-KD에서 의미 지도를 위해 OpenAI CLIP-B/16을 티처로 사용하고, 인코더를 양자화기를 통해 역전파하는 동안 stop-gradient를 적용한다.
- 40% 마스크 비율과 패치별 토큰 예측을 따라 BEiT v2로 Discrete Visual Tokens를 예측하며 ViT 모델을 사전학습한다.
- [CLS] 토큰이 패치 정보를 모으도록 하는 패치 집계 메커니즘을 도입하여 로컬 패치 표현을 글로벌 이미지 표현과 정렬한다.
- 표준 MIM 손실(시각 토큰 재구성)과 전역 표현 질을 촉진하는 CLS 중심 손실을 결합한 사전학습 목표를 사용한다.
- 선택적으로 얕은 Transformer 디코더를 도입하여 CLS 기반의 글로벌 표현을 강화하되 추론 비용은 증가시키지 않는다.
실험 결과
연구 질문
- RQ1의미적 벡터 양자화 시각 토크나이저가 픽셀 수준 타깃보다 마스킹된 이미지 모델링를 개선할 수 있는가?
- RQ2패치 집계 전략이 MIM 사전학습에서 더 나은 글로벌 이미지 표현을 촉진하는가?
- RQ3모델 크기와 사전학습 길이에 따른 ImageNet 미세조정, 선형 탐색, ACE20K 의미 분할에서 BEiT v2의 성능은 얼마인가?
- RQ4VQ-KD 타깃 선택(DINO/CLIP)이 다운스트림 성능에 미치는 영향은 무엇인가?
- RQ5다양한 다운스트림 평가 설정과 강건성 벤치마크에 대한 BEiT v2의 강건성은 어느 정도인가?
주요 결과
- ViT-B/16을 사용하고 300 에포크에서 ImageNet-1K의 top-1 미세조정 정확도 85.0%와 ADE20k mIoU 52.7%를 달성한다.
- ViT-B/16을 사용하고 1600 에포크에서 85.5%의 top-1(ImageNet) 및 53.1% ADE20k mIoU를 달성하며, 중간 ImageNet-21k 미세조정 시 정확도가 각각 86.5%와 53.5%로 향상된다.
- ViT-L/16을 사용하고 300 에포크에서 ImageNet top-1 86.6% 및 ADE20k mIoU 55.0%에 도달하며, 1600 에포크는 87.3% top-1 및 56.7% ADE20k mIoU를 달성한다.
- ImageNet-1K에서 선형 탐색으로 BEiT v2가 80.1% top-1을 달성하여 BEiT, CAE, MVP, MoCo v3의 보고된 비교에서 우수한 성능을 보인다.
- BEiT v2는 MAE와 비교하여 다양한 ImageNet 변형(적대적, 렌더링, 스케치)에서 더 강한 강건성을 보이며 다수의 설정에서 상당한 이득을 보인다.
- 분해 연구는 더 깊은 VQ-KD 디코더가 코드북 사용량 및 다운스트림 성능을 감소시키는 반면, 더 작은 코드북은 사용량과 정확도를 개선한다는 것을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.