Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring the Coordination of Frequency and Attention in Masked Image Modeling

Jie Gui, Chen, Tuo|arXiv (Cornell University)|2022. 11. 28.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 자기주의 주의 맵을 사용해 선택적 마스킹과 불필요한 피처 패치 제거를 유도하는 플러그 앤 플레이 모듈인 Attention-driven Masking and Throwing (AMT)을 제안한다. 주의를 주목할 만한 객체 영역에 집중시키고 전략적인 토큰 제거를 통해 계산량을 줄임으로써, AMT는 다양한 벤치마크에서 선형 프로빙 정확도를 2.9%~5.9% 향상시키고, MAE 및 SimMIM보다 성능을 높이며 사전 훈련 속도를 빠르게 한다.

ABSTRACT

Recently, masked image modeling (MIM), which learns visual representations by reconstructing the masked patches of an image, has dominated self-supervised learning in computer vision. However, the pre-training of MIM always takes massive time due to the large-scale data and large-size backbones. We mainly attribute it to the random patch masking in previous MIM works, which fails to leverage the crucial semantic information for effective visual representation learning. To tackle this issue, we propose the Frequency \& Attention-driven Masking and Throwing Strategy (FAMT), which can extract semantic patches and reduce the number of training patches to boost model performance and training efficiency simultaneously. Specifically, FAMT utilizes the self-attention mechanism to extract semantic information from the image for masking during training in an unsupervised manner. However, attention alone could sometimes focus on inappropriate areas regarding the semantic information. Thus, we are motivated to incorporate the information from the frequency domain into the self-attention mechanism to derive the sampling weights for masking, which captures semantic patches for visual representation learning. Furthermore, we introduce a patch throwing strategy based on the derived sampling weights to reduce the training cost. FAMT can be seamlessly integrated as a plug-and-play module and surpasses previous works, \emph{e.g.} reducing the training phase time by nearly $50\%$ and improving the linear probing accuracy of MAE by $1.3\% \sim 3.9\%$ across various datasets, including CIFAR-10/100, Tiny ImageNet, and ImageNet-1K. FAMT also demonstrates superior performance in downstream detection and segmentation tasks.

연구 동기 및 목표

  • 무작위 마스킹이 배경 영역 등 관련 없는 영역으로 주의를 산산이 흩트리는 문제를 해결하기 위해.
  • 비전 트랜스포머에서 사전 훈련의 높은 계산 비용을 줄이기 위해 훈련 중에 불필요한 패치를 제거함으로써.
  • 비지도 의미론적 주의 맵을 활용해 마스킹 및 제거 전략을 유도함으로써 표현 학습을 향상시키기 위해.
  • 기존의 MIM 프레임워크인 MAE 및 SimMIM과 호환되는 플러그 앤 플레이 모듈을 개발하여 이식성과 효율성을 높이기 위해.
  • 최소한의 아키텍처 변경으로 분류, 검출, 세그멘테이션을 포함한 다운스트림 작업에서 뛰어난 성능을 입증하기 위해.

제안 방법

  • 비전 트랜스포머의 [CLS] 토큰의 자기주의 주의 메커니즘을 사용해 사전 학습 중 비지도 의미 이해를 가능하게 하는 색채도 맵을 추출한다.
  • 높은 주의 가중치를 가진 패치를 선택해 마스킹하는 주의 기반 마스킹을 구현함으로써 모델이 의미적으로 중요한 영역에 집중하도록 유도한다.
  • 낮은 주의도를 가진 토큰을 영구히 제거하는 불필요한 패치 제거 전략을 도입하여 계산 부담을 줄인다.
  • 표현 품질과 훈련 속도의 균형을 맞추기 위해 마스킹 및 제거 비율(예: 45% 마스킹, 40% 제거)을 최적화한다.
  • 백본 아키텍처를 수정하지 않고도 기존의 MIM 프레임워크(예: MAE 및 SimMIM)에 AMT 모듈을 플러그인 방식으로 적용한다.
  • 기준 모델 및 분석 결과 간 공정한 비교를 위해 동일한 훈련 설정을 사용하며, 동일한 초모수 및 평가 프로토콜을 적용한다.

실험 결과

연구 질문

  • RQ1비전 트랜스포머의 자기주의 주의 맵이 마스킹 이미지 모델링에서 비무작위적이고 의미 기반의 마스킹을 효과적으로 이끌 수 있는가?
  • RQ2낮은 주의도 패치를 선택적으로 제거함(던지기)하는 것이 MIM에서 훈련 효율성과 표현 품질을 향상시키는가?
  • RQ3선택적 마스킹 및 제거 전략이 무작위 마스킹 및 제거 없음 전략에 비해 선형 프로빙 및 피니튜닝 정확도에서 어떻게 비교되는가?
  • RQ4AMT는 COCO 및 LVIS와 같은 다운스트림 검출 및 세그멘테이션 작업에서 이식성에 얼마나 기여하는가?
  • RQ5제안된 AMT 아키텍처에서 마스킹 비율, 제거 비율, 성능 간 최적의 트레이드오프는 무엇인가?

주요 결과

  • AMT는 CIFAR-10, CIFAR-100, STL-10, Tiny ImageNet, ImageNet-1K 등 다양한 데이터셋에서 MAE의 선형 프로빙 정확도를 2.9%에서 5.9%까지 향상시켰다.
  • AMT는 ImageNet-1K 및 다운스트림 벤치마크에서 MAE 및 SimMIM의 피니튜닝 정확도를 각각 0.2%에서 5.8%까지 향상시켰다.
  • COCO 검출에서 AMT는 모든 AP 지표에서 일관된 향상을 보였으며, 높은 IoU 임계치에서 AP 및 AP<sup>box</sup>에서 최고 성능을 기록했다.
  • 장기 꼬리 분포를 가진 도전적인 LVIS 데이터셋에서, AMT는 기준 방법 대비 모든 검출 지표를 최소 1.4% 향상시켰다.
  • 40% 제거 및 45% 마스킹 전략을 적용한 AMT 전략은 Tiny ImageNet에서 무작위 제거 및 낮은 주의도 제거 전략보다 0.7% 높은 정확도를 기록했다.
  • 50% 토큰을 제거할 경우 AMT는 사전 훈련 속도를 1.6배로 빠르게 하였으며, ImageNet-1K에서 SimMIM의 무작위 마스킹보다 뛰어난 성능을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.