Skip to main content
QUICK REVIEW

[논문 리뷰] Architecture-Agnostic Masked Image Modeling -- From ViT back to CNN

Siyuan Li, Di Wu|arXiv (Cornell University)|2022. 05. 27.
Advanced Neural Network Applications인용 수 16
한 줄 요약

이 논문은 비전 트랜스포머와 컨volution 네트워크 모두에서 자기지도 학습 표현 학습을 향상시키기 위해 중간 차수의 패치 상호작용을 강화하는 아키텍처에 관계없이 적용 가능한 마스킹 이미지 모델링 프레임워크인 A²MIM을 제안한다. 중간 특징 맵에 마스크 토큰을 적용하고 푸리에 도메인 손실을 도입함으로써 A²MIM는 ViT 전용 설계 없이도 콘트라스트 학습 및 이전의 MIM 방법보다 더 뛰어난 성능을 보이며 ImageNet-1K 및 후속 작업에서 최신 기준을 달성한다.

ABSTRACT

Masked image modeling, an emerging self-supervised pre-training method, has shown impressive success across numerous downstream vision tasks with Vision transformers. Its underlying idea is simple: a portion of the input image is masked out and then reconstructed via a pre-text task. However, the working principle behind MIM is not well explained, and previous studies insist that MIM primarily works for the Transformer family but is incompatible with CNNs. In this work, we observe that MIM essentially teaches the model to learn better middle-order interactions among patches for more generalized feature extraction. We then propose an Architecture-Agnostic Masked Image Modeling framework (A$^2$MIM), which is compatible with both Transformers and CNNs in a unified way. Extensive experiments on popular benchmarks show that A$^2$MIM learns better representations without explicit design and endows the backbone model with the stronger capability to transfer to various downstream tasks.

연구 동기 및 목표

  • 재구성 품질을 넘어서 마스킹 이미지 모델링(MIM)의 기본 메커니즘을 규명하는 것.
  • 이전까지 비전 트랜스포머(ViTs)에만 적용 가능하게 한 MIM 성능의 트랜스포머와 CNN 간 격차를 해소하는 것.
  • CNN과 트랜스포머 양쪽 모두에서 중간 차수의 상호작용을 향상시키는 통합된 아키텍처에 관계없는 MIM 프레임워크를 개발하는 것.
  • MIM의 성공이 재구성 정밀도가 아니라 향상된 패치 상호작용을 통한 일반화된 복잡한 특징 표현 학습에 기인한다는 것을 입증하는 것.
  • 표준 CNN 및 ViT 백본만을 사용하여 ImageNet-1K 및 다양한 벤치마크에서 뛰어난 전이 성능를 달성하는 것.

제안 방법

  • 입력 패치가 아닌 중간 특징 맵에 마스크 토큰을 적용하여 특징 상호작용 학습을 향상시키는 것.
  • 공간적 맥락을 유지하고 분포 이탈을 방지하기 위해 마스킹에 평균 RGB 값을 사용하는 것.
  • 이미지 패치 간 중간 차수의 상호작용을 명시적으로 향상시키기 위해 푸리에 도메인 손실을 도입하는 것.
  • 아키텍처 수정 없이도 CNN과 트랜스포머 양쪽에 호환 가능한 일반화된 프레임워크를 설계하는 것.
  • 재구성에 선형 디코더를 사용하며, 분석을 위해 선택적 깊이 분리 컨볼루션 또는 고급 예측 타겟을 활용하는 것.
  • ResNet, ConvNeXt, ViT 백본을 사용하여 ImageNet-1K 및 후속 작업에서 프레임워크를 검증하는 것.

실험 결과

연구 질문

  • RQ1마스킹 이미지 모델링이 표현 학습을 향상시키는 진정한 기반이 되는 메커니즘은 무엇인가?
  • RQ2비전 트랜스포머에서 성공한 반면 CNN에서는 성능이 열등한 기존 MIM 방법의 이유는 무엇인가?
  • RQ3CNN과 트랜스포머 양쪽에서 중간 차수의 패치 상호작용을 향상시킬 수 있는 통합된 MIM 프레임워크를 설계할 수 있는가?
  • RQ4중간 차수의 상호작용을 향상시키는 것이 더 견고하고 일반화된 시각적 표현을 만들어내는가?
  • RQ5ViT 전용 구성 요소 없이도 A²MIM이 표준 CNN에서 콘트라스트 학습 및 이전의 MIM 방법보다 뛰어난 성능를 보일 수 있는가?

주요 결과

  • MIM의 성공은 재구성 정밀도나 아키텍처 설계가 아니라 패치 간 중간 차수의 상호작용을 향상시키는 데 기인한다.
  • A²MIM는 ResNet-50를 사용해 ImageNet-1K에서 79.0%의 상위-1 정확도를 달성하여 콘트라스트 학습 및 이전의 MIM 방법보다 CNN에서 뛰어난 성능를 보였다.
  • ViT-B는 더 긴 사전 훈련(예: 800 에포크)에서 더 큰 이점을 얻는 반면, ResNet-50는 300 에포크를 초과해도 성능 향상이 없어, 아키텍처의 인덕티브 바이어스가 CNN의 MIM 성능 향상에 제한을 둔다는 것을 시사한다.
  • A²MIM는 상호작용 강도 분포를 향상시켜 기존 방법보다 더 균형 잡히고 복잡한 중간 차수의 상호작용(0.2n에서 0.6n 범위)을 포착한다.
  • DINO 특징이나 HoG와 같은 고급 타겟을 사용하면 A²MIM의 성능이 ResNet-50 기준 79.0%로 향상되고 ViT-B 기준 82.7%로 상승하여 확장 가능성을 확인한다.
  • 푸리에 도메인 손실과 중간 마스킹이 특징 상호작용 학습을 향상시켜 CNN에서 특히 성능 향상을 이끌어내었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.