[논문 리뷰] FastMIM: Expediting Masked Image Modeling Pre-training for Vision
FastMIM은 저해상도 입력(예: 128×128)을 사용하고 원본 RGB 픽셀 대신 방향성 기울기 히스토GRAM(HOG) 특징을 복원함으로써 밀착된 이미지 모델링(MIM) 사전학습을 가속화한다. 이 방법은 메모리 소비와 학습 시간을 약 5배 감소시키며, ViT-B/Swin-B를 사용할 때 ImageNet-1K에서 각각 83.8%/84.1%의 상위-1 정확도를 달성하여 이전 방법과 비교해 유의미하게 빠른 수렴 속도를 보이며 동등하거나 이를 초월한다.
The combination of transformers and masked image modeling (MIM) pre-training framework has shown great potential in various vision tasks. However, the pre-training computational budget is too heavy and withholds the MIM from becoming a practical training paradigm. This paper presents FastMIM, a simple and generic framework for expediting masked image modeling with the following two steps: (i) pre-training vision backbones with low-resolution input images; and (ii) reconstructing Histograms of Oriented Gradients (HOG) feature instead of original RGB values of the input images. In addition, we propose FastMIM-P to progressively enlarge the input resolution during pre-training stage to further enhance the transfer results of models with high capacity. We point out that: (i) a wide range of input resolutions in pre-training phase can lead to similar performances in fine-tuning phase and downstream tasks such as detection and segmentation; (ii) the shallow layers of encoder are more important during pre-training and discarding last several layers can speed up the training stage with no harm to fine-tuning performance; (iii) the decoder should match the size of selected network; and (iv) HOG is more stable than RGB values when resolution transfers;. Equipped with FastMIM, all kinds of vision backbones can be pre-trained in an efficient way. For example, we can achieve 83.8%/84.1% top-1 accuracy on ImageNet-1K with ViT-B/Swin-B as backbones. Compared to previous relevant approaches, we can achieve comparable or better top-1 accuracy while accelerate the training procedure by $\sim$5$ imes$. Code can be found in https://github.com/ggjy/FastMIM.pytorch.
연구 동기 및 목표
- 비전 트랜스포머에서 밀착된 이미지 모델링(MIM) 사전학습의 높은 계산 비용과 메모리 부담 문제를 해결하기 위해.
- 계층적 아키텍처인 Swin 트랜스포머를 포함한 다양한 비전 백본에 대해 효율적이고 일반적인 사전학습을 가능하게 하기 위해.
- 하류 작업 성능을 희생시키지 않고 학습 시간과 메모리 사용량을 줄이기 위해.
- 입력 해상도, 특징 표현 방식(RGB 대비 HOG), 그리고 네트워크 깊이가 MIM의 효율성과 정확도에 미치는 영향을 조사하기 위해.
제안 방법
- 계산 부담과 메모리 사용량을 줄이기 위해 저해상도 입력 이미지(예: 224×224 대신 128×128)를 사용하여 비전 백본을 사전학습한다.
- 픽셀 복원을 방향성 기울기 히스토GRAM(HOG) 특징 복원으로 대체하여 해상도 감소에도 불구하고 텍스처와 에지 정보를 유지한다.
- 모든 입력 토큰을 사전학습 기간 동안 유지하는 대칭형 인코더-디코더 아키텍처를 사용하여 다양한 백본 아키텍처와의 호환성을 확보한다.
- 학습 안정성과 성능을 유지하기 위해 디코더 크기를 선택한 인코더의 특징 맵 차원에 맞춘다.
- 사전학습 기간 동안 점진적으로 입력 해상도를 증가시키는 점진적 해상도 스케줄링 전략인 FastMIM-P를 도입하여 모델 용량과 전이 성능를 향상시킨다.
- HOG 특징이 기하학적 및 해상도 변화에 대해 불변성을 가지므로, 저해상도 설정에서 원본 픽셀 대비 더 견고한 목표로 작용한다.
실험 결과
연구 질문
- RQ1MIM 사전학습 중에 입력 해상도를 낮추는 것이 하류 성능을 떨어뜨리지 않고 학습을 상당히 가속화할 수 있는가?
- RQ2저해상도 입력을 사용할 때 텍스처 정보 손실을 방지하기 위해 원본 픽셀 대신 HOG 특징을 복원하는 것이 효과적인가?
- RQ3예측 타겟으로 RGB 대비 HOG를 선택할 경우, 저해상도 MIM에서 학습 안정성과 수렴 속도에 어떤 영향을 미치는가?
- RQ4사전학습 중에 인코더의 얕은 층을 우선적으로 학습할 수 있는가? 더 깊은 층을 제거하면 학습 속도를 더 빠르게 만들 수 있는가?
- RQ5사전학습 기간 동안 점진적 입력 해상도 스케줄링을 적용하면 고용량 모델의 전이 성능를 향상시킬 수 있는가?
주요 결과
- FastMIM은 MAE 및 SimMIM 대비 사전학습 시간을 약 5배 감소시켰으며, ViT-B와 Swin-B 백본을 사용할 때 각각 ImageNet-1K에서 83.8% 및 84.1%의 상위-1 정확도를 달성하였다.
- 원본 RGB 픽셀 대신 HOG 특징을 복원할 경우, 저해상도 입력 조건에서도 사전학습 손실이 유의미하게 낮아지고 복원 품질이 향상되어 모호성이 감소하고 학습 안정성이 향상된다.
- HOG 타겟을 사용할 경우, 다양한 해상도 간 성능 격차가 크게 줄어들어 HOG가 해상도 변화에 대해 뛰어난 내성성을 보임을 입증한다.
- 사전학습 중에 인코더의 마지막 몇 층을 제거해도 미세조정 성능에 영향을 주지 않으며, 이는 정확도 손실를 최소화하면서도 더 빠른 학습을 가능하게 한다.
- 인코더의 얕은 층은 사전학습에서 더 중요하며, 그 표현 품질이 하류 전이 성능에 강력한 영향을 미친다.
- 점진적 입력 해상도 스케줄링 전략인 FastMIM-P는 특히 고용량 모델인 Swin-L과 같은 모델의 전이 성능를 추가로 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.