[논문 리뷰] Extreme Masking for Learning Instance and Distributed Visual Representations
ExtreMA는 시amese 표현 학습을 위한 새로운 자기지도 학습 방법을 제안하며, 극단적 마스킹(75%-90%)을 데이터 증강 기법으로 사용한다. 학생 네트워크는 단순한 BYOL 목적함수를 통해 마스킹된 시각에서 전체 이미지 표현을 예측하도록 훈련된다. 이 방법은 이미지넷, ADE20K, COCO에서 선형 프로빙 및 전이 성능 측면에서 최신 기준(SOTA)을 달성하며, MAE와 DINO를 능가하지만 계산 자원을 훨씬 적게 소비한다.
The paper presents a scalable approach for learning spatially distributed visual representations over individual tokens and a holistic instance representation simultaneously. We use self-attention blocks to represent spatially distributed tokens, followed by cross-attention blocks to aggregate the holistic image instance. The core of the approach is the use of extremely large token masking (75\%-90\%) as the data augmentation for supervision. Our model, named ExtreMA, follows the plain BYOL approach where the instance representation from the unmasked subset is trained to predict that from the intact input. Instead of encouraging invariance across inputs, the model is required to capture informative variations in an image. The paper makes three contributions: 1) It presents random masking as a strong and computationally efficient data augmentation for siamese representation learning. 2) With multiple sampling per instance, extreme masking greatly speeds up learning and improves performance with more data. 3) ExtreMA obtains stronger linear probing performance than masked modeling methods, and better transfer performance than prior contrastive models.
연구 동기 및 목표
- 극단적 마스킹을 시amese 표현 학습을 위한 새로운 데이터 증강 기법으로 활용할 수 있는지 탐색한다.
- 명시적인 마스킹 모델링 감독 없이도 분산(토큰 수준) 및 통합(인스턴스 수준) 시각 표현을 동시에 학습한다.
- 높은 마스킹 비율과 이미지당 다중 샘플링을 통해 학습 효율성과 성능을 향상시킨다.
- 중대한 아키텍처 수정 없이도 최신 대비 경쟁력 있는 전이 성능을 달성한다.
제안 방법
- ExtreMA는 영상 패치에 대해 공간적으로 분산된 표현을 인코딩하기 위해 비전 트랜스포머(ViT)를 사용한다.
- 크로스 어텐션 블록은 분산 표현을 통합된 인스턴스 표현으로 집계한다.
- 모델은 입력 이미지에 대해 극단적 마스킹(75%-90%)을 적용하여 데이터 증강 전략으로 활용한다.
- 학습된 학생 네트워크는 마스킹된 시각을 입력으로 사용하여 전체 입력의 인스턴스 표현을 예측하도록 단순한 BYOL 스타일 목적함수로 훈련된다.
- 이미지당 다수의 랜덤 마스킹을 적용하여 데이터 다양성을 높이고 수렴 속도를 가속화한다.
- 선생 네트워크는 모멘타ム 업데이트 방식으로 갱신되며, 학생 네트워크는 전체 시각과 마스킹된 시각 간의 대비 손실을 최소화하도록 훈련된다.
실험 결과
연구 질문
- RQ1극단적 마스킹(75%-90%)이 시amese 표현 학습을 위한 효과적이고 효율적인 데이터 증강 기법으로 기능할 수 있는가?
- RQ2마스킹된 시각을 통한 인스턴스 수준 표현 예측이 기존의 마스킹 모델링 및 대비 학습 방식을 능가하는가?
- RQ3높은 마스킹 비율을 사용한 다중 마스킹이 학습 속도와 모델 성능에 어떤 영향을 미치는가?
- RQ4ExtreMA는 중대한 아키텍처 수정 없이도 강력한 제로샷 및 미세조정 전이 성능을 달성할 수 있는가?
주요 결과
- ExtreMA는 300 에포크와 1%의 레이블된 데이터만으로 ImageNet-1k에서 67.3%의 선형 프로빙 정확도를 달성하며, 동일 조건에서 DINO(64.7%)와 MAE(52.7%)를 모두 능가한다.
- ADE20K 세그멘테이션 작업에서, ExtreMA는 ImageNet-22k에서 30 에포크만으로 사전 훈련해 48.4 mIoU를 달성했으며, 1600 에포크를 사용한 MAE(48.1 mIoU)를 뛰어넘었다.
- COCO 객체 검출 작업에서, ExtreMA는 ImageNet-22k에서 30 에포크 훈련으로 48.5 AP를 기록했으며, 300 에포크에서 훈련한 MAE(48.4 AP)와 400 에포크에서 훈련한 DINO(46.8 AP)를 모두 능가했다.
- ExtreMA는 MAE와 DINO보다 수렴 속도가 더 빠르며, 계산 자원을 훨씬 적게 사용하면서도 MSN 및 MoCo-v3와 수준이 비슷하거나 뛰어난 성능을 보였다.
- 주의 맵에서 공간적 대응 관계가 정확하게 유지되어, 분산 표현이 의미적으로 유의미하고 공간적으로 일관된 것으로 나타났다.
- ExtreMA는 데이터에 대해 잘 스케일링된다: ImageNet-22k로 훈련 데이터를 늘릴 경우 ADE20K에서 성능이 0.5 mIoU 향상되어 강력한 데이터 효율성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.