Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring Long-Sequence Masked Autoencoders

Ronghang Hu, Shoubhik Debnath|arXiv (Cornell University)|2022. 10. 13.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 입력 시퀀스 길이가 더 긴 경우에도 추가적인 추론 비용 없이 효과적인 사전 훈련을 가능하게 하기 위해 마스크 크기와 패치 크기를 분리한 장기 시퀀스 마스크된 오토인코더(MAE)를 제안한다. 인접한 패치들을 함께 마스킹함으로써(예: 2×2 그룹), 재구성 과제의 난이도를 유지하고, 다양한 데이터셋에서 객체 검출, 인스턴스 세그멘테이션, 세그멘테이션 작업에서 일관된 성능 향상을 이룬다. 특히 COCO와 ADE20K에서 두드러진 개선을 보였으며, 장기 시퀀스를 사용할 경우 ImageNet-1K에서도 뛰어난 성능을 기록한다.

ABSTRACT

Masked Autoencoding (MAE) has emerged as an effective approach for pre-training representations across multiple domains. In contrast to discrete tokens in natural languages, the input for image MAE is continuous and subject to additional specifications. We systematically study each input specification during the pre-training stage, and find sequence length is a key axis that further scales MAE. Our study leads to a long-sequence version of MAE with minimal changes to the original recipe, by just decoupling the mask size from the patch size. For object detection and semantic segmentation, our long-sequence MAE shows consistent gains across all the experimental setups without extra computation cost during the transfer. While long-sequence pre-training is discerned most beneficial for detection and segmentation, we also achieve strong results on ImageNet-1K classification by keeping a standard image size and only increasing the sequence length. We hope our findings can provide new insights and avenues for scaling in computer vision.

연구 동기 및 목표

  • 장기 시퀀스, 고해상도 입력에 대해 마스크된 오토인코딩의 영향을 분석함으로써 컴퓨터 비전에서의 표현 학습에 미치는 영향을 조사한다.
  • 기본 이미지 해상도를 초월해 시퀀스 길이를 늘릴 경우, 추론 비용을 증가시키지 않고도 표현 학습을 향상시킬 수 있는지 확인한다.
  • 표준 MAE에 최소한의 수정을 가하여 마스크 크기를 패치 크기에서 분리함으로써 장기 시퀀스 사전 훈련을 가능하게 하는 방법을 개발한다.
  • 다양한 비전 작업, 즉 객체 검출, 세그멘테이션, 이미지 분류를 여러 벤치마크에서 평가한다.
  • 장기 시퀀스 사전 훈련이 인스턴스 세그멘테이션 및 세그멘테이션과 같은 고내용, 고복잡도 작업에 특히 유리한지 입증한다.

제안 방법

  • 인접한 패치들을 그룹화함으로써(예: 2×2) 마스크 크기를 패치 크기에서 분리하여, 장기 시퀀스 길이에서도 과제 난이도를 유지한다.
  • 데이터 로더를 수정하여 개별적으로 마스크하지 않고, 함께 마스크된 패치 인덱스를 생성함으로써 일관된 마스크 비율과 난이도를 유지한다.
  • ViT-B의 경우, 인코더와의 아키텍처 균형을 유지하기 위해 더 작은 디코더(은닉 크기 384, 12헤드)를 사용한다.
  • 시퀀스 길이가 196에서 784패치로 증가할 때(예: 224×224에서 512×512 이미지로)에도 재구성 난이도를 유지하기 위해 공동 마스킹을 적용한다.
  • 필요에 따라 디코더 시퀀스 길이를 줄이기 위해 학습 가능한 2×2 컨볼루션 레이어를 사용하여 재구성 과정에서 공간 해상도를 유지한다.
  • COCO의 unlabeled2017 분할 데이터셋(241,690장의 이미지)과 같은 확장된 데이터셋을 사용하여 사전 훈련함으로써 데이터 크기를 두 배로 늘리고, 후속 전이 성능 향상을 이룬다.

실험 결과

연구 질문

  • RQ1마스크된 오토인코딩에서 입력 시퀀스 길이를 늘일 경우, 컴퓨터 비전에서 표현 학습이 향상되는가?
  • RQ2장기 시퀀스 MAE는 추론 비용을 증가시키지 않고도 객체 검출 및 세그멘테이션과 같은 밀도 높은 예측 작업에서 더 높은 성능을 달성할 수 있는가?
  • RQ3마스크 크기를 패치 크기에서 분리할 경우, 장기 시퀀스 MAE의 안정성과 성능에 어떤 영향을 미치는가?
  • RQ4장기 시퀀스 사전 훈련의 이점이 표준 이미지 분류보다 고내용, 고복잡도 장면에 더 두드러지는가?
  • RQ5장기 시퀀스 MAE는 입력 해상도를 늘리지 않아도 경쟁력 있는 ImageNet-1K 정확도를 달성할 수 있는가?

주요 결과

  • 장기 시퀀스 MAE는 기준 모델 대비 COCO 객체 검출에서 1.3 APb와 1.2 APm 향상되었으며, ADE20K 세그멘테이션에서는 2.6 mIoU 향상되었고, 추가적인 추론 비용 없이 성능 향상을 이룬다.
  • COCO에서 ViT-B는 장기 시퀀스 MAE로 51.0 APb와 45.3 APm을 달성했으며, 기준 모델은 각각 49.7과 44.1이었다.
  • ViT-L의 경우 성능 향상이 더욱 두드러졌다: 52.3 APb와 46.4 APm(기준 모델은 50.7과 44.9), ADE20K에서 3.0 mIoU 향상.
  • train2017 + unlabeled2017 분할 데이터셋(241,690장의 이미지)을 사용해 사전 훈련하면 후속 작업 성능이 크게 향상되며, 이는 장기 시퀀스 MAE가 더 큰 데이터셋에 스케일러블함을 확인한다.
  • ImageNet-1K에서 512×512 입력을 사용할 경우, 장기 시퀀스 MAE는 상위-1 정확도 83.4%를 기록했으며, 이는 표준 224×224 코너스와 448×448 평가를 사용한 경우와 동일한 성능를 달성한다.
  • 성능 향상은 특히 밀도 높은 예측 작업에서 두드러지며, 이는 장기 시퀀스가 복잡한 장면에서 더 나은 문맥적 및 공간적 종속성을 포착할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.