Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Frequency Modeling for Self-Supervised Visual Pre-Training

Jiahao Xie, Wei Li|arXiv (Cornell University)|2022. 06. 15.
Image Processing Techniques and Applications인용 수 28
한 줄 요약

MFM은 프 Fourier 도메인에서 주파수 구성요소를 마스킹하고 누락된 주파수를 예측하여 ViT와 CNN의 시각 표현을 학습하고 마스크 토큰 없이 경쟁력 있는 성능과 기존 MIM 방법에 대한 강건성을 얻습니다.

ABSTRACT

We present Masked Frequency Modeling (MFM), a unified frequency-domain-based approach for self-supervised pre-training of visual models. Instead of randomly inserting mask tokens to the input embeddings in the spatial domain, in this paper, we shift the perspective to the frequency domain. Specifically, MFM first masks out a portion of frequency components of the input image and then predicts the missing frequencies on the frequency spectrum. Our key insight is that predicting masked components in the frequency domain is more ideal to reveal underlying image patterns rather than predicting masked patches in the spatial domain, due to the heavy spatial redundancy. Our findings suggest that with the right configuration of mask-and-predict strategy, both the structural information within high-frequency components and the low-level statistics among low-frequency counterparts are useful in learning good representations. For the first time, MFM demonstrates that, for both ViT and CNN, a simple non-Siamese framework can learn meaningful representations even using none of the following: (i) extra data, (ii) extra model, (iii) mask token. Experimental results on image classification and semantic segmentation, as well as several robustness benchmarks show the competitive performance and advanced robustness of MFM compared with recent masked image modeling approaches. Furthermore, we also comprehensively investigate the effectiveness of classical image restoration tasks for representation learning from a unified frequency perspective and reveal their intriguing relations with our MFM approach.

연구 동기 및 목표

  • 주파수 도메인에서의 마스킹이 공간 마스킹보다 더 나은 자가 지도 표현을 이끌어낼 수 있는지 조사한다.
  • 마스크 토큰에 의존하지 않는 유연하고 아키텍처에 구애받지 않는 사전 학습 프레임워크(ViT 및 CNN)를 개발한다.
  • 주파수 도메인 오염과 전통적인 저수준 공간 손상 및 기존의 MIM 방법을 비교한다.
  • 이미지 분류 및 시맨틱 분할에서 MFM을 평가하고 여러 벤치마크에서 강건성을 평가한다.
  • 통일된 주파수 관점에서 고전적 이미지 복원 작업과 MFM 간의 관계를 탐구한다.

제안 방법

  • 이미지를 FFT를 사용하여 주파수 도메인으로 변환하고 반지름 r의 원형 마스크를 가진 로우패스/하이패스 필터를 통해 일부 주파수 구성요소를 마스킹한다.
  • 로우패스와 하이패스 마스크 입력 중 하나를 임의로 선택하고 손상된 공간 도메인 이미지를 인코더(ViT 또는 CNN)에 입력하되 마스크 토큰을 삽입하지 않는다.
  • 가벼운 선형 디코더를 사용하여 주파수 스펙트럼에서 마스킹된 주파수를 주파수 도메인 손실로 재구성한다.
  • 재구성 손실을 마스킹된 스펙트럼 전체의 크기 차이와 위상 차이를 결합한 주파수 거리로 정의한다 (L = 마스킹된 스펙트럼의 평균 |F_r - F_o|^gamma, gamma 보통 1).
  • ImageNet-1K에서 자기지도 방식으로 학습하고 하류를 ImageNet-1K 미세 조정 및 ADE20K 시맨틱 분할에서 평가한다.
  • 마스킹된 스펙트럼만 예측하는 것이 전체 스펙트럼 재구성보다 더 효과적이며 주파수 도메인 손실이 공간 손실보다 우수하다는 것을 보인다.

실험 결과

연구 질문

  • RQ1주파수 도메인에서의 마스킹이 마스크 토큰 없이 ViT와 CNN에 더 풍부한 표현을 학습하게 할 수 있는가?
  • RQ2마스크 유형(로우패스/하이패스/랜덤), 반경, 모양, 샘플링이 MFM 성능에 어떤 영향을 미치는가?
  • RQ3MFM이 성능 및 강건성 측면에서 저수준 이미지 복원 작업 및 기존 MIM 방법과 어떻게 비교되는가?
  • RQ4ViT 및 ResNet-50과 같은 아키텍처로 ImageNet 분류 및 ADE20K 분할에서 MFM이 경쟁력 있는 결과를 얻을 수 있는가?
  • RQ5벤치마크 전반에 걸친 적대적 공격 및 일반적인 손상에 대한 강건성에 대한 MFM의 영향은 무엇인가?

주요 결과

  • MFM은 300-에포크 사전 학습 후 ImageNet-1K에서 ViT-B/16에서 83.1% top-1, ViT-S/16에서 81.6%를 달성합니다 (마스크 토큰 없이).
  • ADE20K에서 MFM을 적용한 ViT-B/16은 48.6 mIoU에 도달하여 여러 자기지도 방법 및 일부 설정에서 감독학습 기준치를 능가합니다.
  • MFM은 강건성 벤치마크에서 상위 방법들 중 하나로 자주 순위에 들며 표준 정확도도 높은 편을 유지합니다(예: 표 6의 강건성 지표).
  • 로우-/하이패스 주파수 마스킹, 무작위 마스킹, 그리고 마스킹된 스펙트럼만 예측하는 것이 전체 스펙트럼 재구성보다 성능을 향상시킵니다.
  • 저수준 이미지 처리 작업(SR, 디블러링, 디노이징)과 비교할 때, 주파수 도메인 관점은 이들의 효과와 ViT 대 CNN 같은 아키텍처와의 상호작용을 보여줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.