Skip to main content
QUICK REVIEW

[논문 리뷰] CAE v2: Context Autoencoder with CLIP Target

Xinyu Zhang, Jiahui Chen|arXiv (Cornell University)|2022. 11. 17.
Advanced Neural Network Applications인용 수 8
한 줄 요약

CAE v2는 마스크된 패치가 아닌 가시 패치에서 학습하고 모델 크기에 따라 변하는 마스크 비율을 사용함으로써 CLIP 대상 지도를 갖춘 컨텍스트 자동에코더를 제안하며, 자기 지도 시각 사전 학습에서 최신 기술 성능을 달성한다. ViT-Large를 사용하여 300 에포크 동안 사전 학습한 후 ImageNet-1K에서 선형 프로빙으로 81.7%의 top-1 정확도와 ADE20K 세그멘테이션에서 55.9%의 mIoU를 기록한다.

ABSTRACT

Masked image modeling (MIM) learns visual representation by masking and reconstructing image patches. Applying the reconstruction supervision on the CLIP representation has been proven effective for MIM. However, it is still under-explored how CLIP supervision in MIM influences performance. To investigate strategies for refining the CLIP-targeted MIM, we study two critical elements in MIM, i.e., the supervision position and the mask ratio, and reveal two interesting perspectives, relying on our developed simple pipeline, context autodecoder with CLIP target (CAE v2). Firstly, we observe that the supervision on visible patches achieves remarkable performance, even better than that on masked patches, where the latter is the standard format in the existing MIM methods. Secondly, the optimal mask ratio positively correlates to the model size. That is to say, the smaller the model, the lower the mask ratio needs to be. Driven by these two discoveries, our simple and concise approach CAE v2 achieves superior performance on a series of downstream tasks. For example, a vanilla ViT-Large model achieves 81.7% and 86.7% top-1 accuracy on linear probing and fine-tuning on ImageNet-1K, and 55.9% mIoU on semantic segmentation on ADE20K with the pre-training for 300 epochs. We hope our findings can be helpful guidelines for the pre-training in the MIM area, especially for the small-scale models.

연구 동기 및 목표

  • CLIP을 지도 타겟으로 사용할 때, 지도의 위치와 마스크 비율이 마스크된 이미지 모델링(MIM)에 미치는 영향을 조사하는 것.
  • CLIP 대상 파라다임 하에서 기존 방법을 능가하는 단순하면서도 효과적인 MIM 프레임워크를 개발하는 것.
  • 특히 소규모 모델을 위한 사전 학습에 실용적인 지침을 제공하는 것.
  • 가시 패치에 대한 특징 증류의 영향과 최적의 마스크 비율과 모델 크기 간의 관계를 규명하는 것.

제안 방법

  • CAE v2는 모델 크기에 정비례하는 비율 γ로 마스크된 후에 가시 이미지 패치를 처리하기 위해 비전 트랜스포머 인코더를 사용한다.
  • 디코더는 인코딩된 가시 특징과 학습된 마스크 토큰에서 마스크된 패치를 재구성한다.
  • 모델은 가시 패치와 마스크된 패치 모두에 대한 잠재 표현을 예측하고, 이를 공유 공간으로 투영한다.
  • 원본 이미지의 CLIP 특징을 지도 타겟으로 사용하며, 패치 위치에 따라 가시 및 마스크된 구성요소로 분할한다.
  • 주 학습 손실은 가시 패치의 예측과 해당 CLIP 타겟에만 적용되며, 마스크된 패치의 지도는 선택 사항이다.
  • 가시 패치 예측에 대해 대비 유사한 목표를 갖는 종합적인 엔드 투 엔드 학습 프레임워크로 구현된다.

실험 결과

연구 질문

  • RQ1CLIP 지도를 마스크된 패치가 아닌 가시 패치에 적용할 경우 CLIP 대상 MIM에서 성능 향상이 이루어지는가?
  • RQ2CLIP 대상 MIM에서 최적의 마스크 비율은 모델 크기에 따라 어떻게 변화하는가?
  • RQ3가시 패치 지도와 적응형 마스크 비율을 갖는 단순한 MIM 파이프라인은 기존 방법을 능가할 수 있는가?
  • RQ4CLIP 대상 MIM에서 가시 패치와 마스크된 패치의 지도 간 상대 기여도는 어떠한가?

주요 결과

  • CLIP 특징을 사용해 가시 패치에만 지도를 적용하는 것이 마스크된 패치에만 지도를 적용하는 것보다 성능이 뛰어나며, 이는 가시 패치가 CLIP로부터 의미 정보를 효과적으로 증류함을 시사한다.
  • 가시 패치와 마스크된 패치에 모두 지도를 적용해도 성능 향상이 미미하여, 가시 패치 지도가 충분하고 매우 효과적임을 시사한다.
  • 최적의 마스크 비율은 모델 크기에 정비례한다: 작은 모델은 낮은 마스크 비율에서 가장 우수한 성능를 보이며, 큰 모델은 높은 마스크 비율에서 유리하다.
  • CAE v2는 ViT-Large 기반으로 300 에포크 사전 학습 후 선형 프로빙으로 ImageNet-1K에서 81.7%의 top-1 정확도를 기록했으며, 피넷팅을 사용할 경우 86.7%의 정확도를 달성한다.
  • ADE20K 세그멘테이션에서 동일한 ViT-Large 모델과 300-에포크 사전 학습을 사용하여 CAE v2는 55.9%의 mIoU를 기록한다.
  • 더 적은 사전 학습 에포크로도 COCO 객체 검출 및 인스턴스 세그멘테이션 벤치마크에서 iBOT 및 CAE와 같은 이전 최신 기술 방법을 능가하는 성능을 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.