Skip to main content
QUICK REVIEW

[논문 리뷰] Masked Image Modeling with Local Multi-Scale Reconstruction

Haoqing Wang, Yehui Tang|arXiv (Cornell University)|2023. 03. 09.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 비전 트랜스포머의 여러 로컬 레이어에 다중 척도 복원을 적용함으로써 자기지도 학습 표현 학습을 가속화하는 LocalMIM이라는 마스킹 이미지 모델링 방법을 제안한다. 하위 레이어는 미세 척도 신호를 복원하고 상위 레이어는 거친 척도 신호를 복원하도록 경량 디코더를 사용함으로써, 이 방법은 척도 간 특징 학습을 명시적으로 이끌어내며, ViT-B의 경우 0.7 GPU 시간으로 전처리 계산을 크게 줄였음에도 불구하고 다운스트림 작업에서 높은 정확도를 유지하면서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Masked Image Modeling (MIM) achieves outstanding success in self-supervised representation learning. Unfortunately, MIM models typically have huge computational burden and slow learning process, which is an inevitable obstacle for their industrial applications. Although the lower layers play the key role in MIM, existing MIM models conduct reconstruction task only at the top layer of encoder. The lower layers are not explicitly guided and the interaction among their patches is only used for calculating new activations. Considering the reconstruction task requires non-trivial inter-patch interactions to reason target signals, we apply it to multiple local layers including lower and upper layers. Further, since the multiple layers expect to learn the information of different scales, we design local multi-scale reconstruction, where the lower and upper layers reconstruct fine-scale and coarse-scale supervision signals respectively. This design not only accelerates the representation learning process by explicitly guiding multiple layers, but also facilitates multi-scale semantical understanding to the input. Extensive experiments show that with significantly less pre-training burden, our model achieves comparable or better performance on classification, detection and segmentation tasks than existing MIM models.

연구 동기 및 목표

  • 기존 마스킹 이미지 모델링(MIM) 방법이 상위 레이어 복원에만 의존함으로써 발생하는 높은 계산 비용과 느린 학습 속도를 해결하기 위해.
  • 다중 척도 복원을 통해 인코더의 하위 및 상위 레이어를 명시적으로 이끌어, 표현 학습 효율성을 향상시키기 위해.
  • 하위 레이어에 미세 척도 감독을, 상위 레이어에 거친 척도 감독을 할당하여 다중 척도 의미 이해를 가능하게 하기 위해.
  • 코드북이나 트레이너 네트워크와 같은 추가 컴포넌트 없이도 전처리 부담을 줄이기 위해.
  • 다양한 네트워크 세그먼트의 훈련을 분리하고 효율적인 역전파를 가능하게 하는 기울기 격리 훈련의 효과를 검증하기 위해.

제안 방법

  • 이 방법은 특정한 하위 레이어가 작은 입력 영역에서 유래한 미세 척도 감독을 복원하고, 상위 레이어가 더 큰 영역에서 유래한 거친 척도 감독을 복원하도록, 여러 로컬 레이어에 복원 작업을 적용한다.
  • 다양한 척도(예: 28², 14², 7²)에서 입력 이미지를 분할하고, 픽셀 값 또는 HOG 특징과 같은 특징 서술자를 적용하여 다중 척도 감독을 추출한다.
  • Transformer 블록과 디컨볼루션/풀링 레이어를 포함한 경량 디코더를 사용하여 예측을 감독 신호 척도에 맞추어 재스케일링함으로써, 엔드 투 엔드 훈련을 가능하게 한다.
  • 비대칭 인코더-디코더 전략을 사용하며, 전처리 중 계산 비용을 최소화하기 위해 오직 가시 패치만 인코더에 입력한다.
  • 기울기 격리 훈련을 적용하여, 각 로컬 복원 레이어 후에 역전파를 중단함으로써, 다양한 네트워크 세그먼트의 훈련을 분리한다.
  • 기본 기둥형 ViT 및 계층적 Swin 트랜스포머 아키텍처에서 이 방법을 평가하였으며, 레이어 선택 및 감독 척도에 대한 추론 연구를 수행하였다.

실험 결과

연구 질문

  • RQ1상위 레이어뿐 아니라 여러 로컬 레이어에 복원 작업을 적용할 경우, MIM에서 자기지도 표현 학습의 속도가 가속화되는가?
  • RQ2하위 레이어에 미세 척도 감독, 상위 레이어에 거친 척도 감독을 할당하면 다중 척도 의미 이해 및 모델 성능이 향상되는가?
  • RQ3로컬 다중 척도 복원이 정확도를 손상시키지 않고 전처리 시간과 계산 비용을 줄일 수 있는가?
  • RQ4각 로컬 레이어 후에 기울기를 정지시키는 기울기 격리 훈련이 성능을 유지하면서도 효율적이고 분리된 훈련을 가능하게 하는가?
  • RQ5ViT 및 Swin 아키텍처에서 성능은 로컬 레이어 선택 및 감독 척도에 얼마나 민감한가?

주요 결과

  • ViT-B를 사용할 때 LocalMIM은 오직 0.7 GPU 시간으로 ImageNet-1K에서 83.3%의 Top-1 정확도를 달성하여 기존 MIM 모델 대비 전처리 비용을 크게 줄였다.
  • 1.1 GPU 시간으로 LocalMIM은 Swin-B에서 83.8%의 정확도를 달성하여, 더 짧은 훈련 시간에도 불구하고 기존 방법을 뛰어넘거나 동등하게 성능을 내었다.
  • Swin 스타일의 레이어 분할 [2,4,10,12]과 미세에서 거친 척도로의 다중 척도 감독 [28²,14²,7²,7²]이 ViT에서 최고의 성능을 냈다.
  • 기울기 격리 훈련은 ViT-B에서 83.0%의 정확도, Swin-B에서 83.7%의 정확도를 기록하여 전역 역전파와 거의 동일한 성능를 유지함으로써, 국소 감독의 효과성을 입증하였다.
  • 다중 척도 감독은 단일 척도 감독보다 우수하며, 거친 척도에서 미세 척도로의 감독이 미세에서 거친 척도로의 감독보다 더 효과적이었으며, 생물학적 및 아키텍처 사전 지식과 일치하였다.
  • 시각화 결과, LocalMIM의 자기주의 기반 어텐션 메커니즘이 작업별 특화 감독 없이도 전경 객체와 의미적으로 일관된 영역을 효과적으로 구분함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.