Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervision through Random Segments with Autoregressive Coding (RandSAC)

Tianyu Hua, Yonglong Tian|arXiv (Cornell University)|2022. 03. 22.
Visual Attention and Saliency Detection인용 수 5
한 줄 요약

RandSAC는 비전 트랜스포머를 위한 새로운 자기지도 학습 사전 훈련 방법을 제안하며, 짧은 범위(세그먼트 내부)와 긴 범위(세그먼트 간)의 순차적 예측을 가능하게 하기 위해 무작위로 순서가 정렬된 계층적 이미지 세그먼트를 사용한다. 세그먼트 내부에서는 BERT 스타일의 병렬 예측과 세그먼트 간에는 GPT 스타일의 순차적 예측을 결합함으로써, RandSAC는 ImageNet과 CIFAR 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, MAE나 iGPT와 같은 비순차적 예측 방법보다 뛰어나며, 특히 데이터가 적은 환경에서 두각을 나타낸다.

ABSTRACT

Inspired by the success of self-supervised autoregressive representation learning in natural language (GPT and its variants), and advances in recent visual architecture design with Vision Transformers (ViTs), in this paper, we explore the effect various design choices have on the success of applying such training strategies for visual feature learning. Specifically, we introduce a novel strategy that we call Random Segments with Autoregressive Coding (RandSAC). In RandSAC, we group patch representations (image tokens) into hierarchically arranged segments; within each segment, tokens are predicted in parallel, similar to BERT, while across segment predictions are sequential, similar to GPT. We illustrate that randomized serialization of the segments significantly improves the performance and results in distribution over spatially-long (across-segments) and -short (within-segment) predictions which are effective for feature learning. We illustrate the pertinence of these design choices and explore alternatives on a number of datasets (e.g., CIFAR10, CIFAR100, ImageNet). While our pre-training strategy works with a vanilla Transformer, we also propose a conceptually simple, but highly effective, addition to the decoder that allows learnable skip-connections to encoder$'$s feature layers, which further improves the performance.

연구 동기 및 목표

  • 이전에 자연어 처리(NLP)에서 성공한 순차적 예측 전략이 비전 트랜스포머를 통해 어떻게 효과적으로 적용될 수 있는지 조사하기 위해.
  • 토크나이제이션의 세분성, 세그먼트 형태, 그리고 순서화 순서가 시각적 특징 학습 성능에 미치는 영향을 탐색하기 위해.
  • 순차적 이미지 모델링에서 결정적 래스터 순서의 한계를 해결하기 위해 무작위로 순서가 정렬된 세그먼트 순행을 도입하기 위해.
  • 에코더와 디코더 레이어 간의 학습 가능한 스킵 커넥션 메커니즘을 통해 ViT 성능을 향상시키기 위해.

제안 방법

  • 이미지가 계층적 세그먼트(예: 2×2 패치 또는 블롭 모양의 영역)로 나뉘며, 다중 척도 토큰 표현을 형성한다.
  • 각 세그먼트 내부에서는 토큰이 병렬로 예측된다(비트 스타일), 반면 세그먼트는 무작위 순서로 순차적으로 예측된다(GPT 스타일).
  • 세그먼트의 무작위 순서화는 데이터 증강을 제공하고 예측 작업 분포의 다양성을 증가시켜 일반화 능력을 향상시킨다.
  • 에코더 특징 맵에서 온 학습 가능한 스킵 커넥션을 제공하는 새로운 디코더 아키텍처가 도입되며, 이는 특징 전파와 표현 품질을 향상시킨다.
  • 모델은 세그먼트 예측에 대한 순차적 교차 엔트로피 손실을 사용하여 훈련되며, 대조 목적이 필요로 하지 않는다.
  • 표준 ViT 백본을 사용하여 ImageNet과 CIFAR 데이터셋에서 사전 훈련을 수행하며, 선형 프로빙과 파인튜닝을 통한 평가를 실시한다.

실험 결과

연구 질문

  • RQ1세그먼트의 세분성과 형태(예: 정사각형 대비 블롭) 선택이 자기지도 시각 표현 학습에 어떤 영향을 미치는가?
  • RQ2무작위로 순서가 정렬된 세그먼트가 순차적 이미지 모델링에서 결정적 래스터 순서보다 우월한가?
  • RQ3에코더와 디코더 레이어 간의 학습 가능한 스킵 커넥션 메커니즘이 비전 트랜스포머의 순차적 사전 훈련 성능을 향상시킬 수 있는가?
  • RQ4낮은 데이터 및 전체 데이터 설정에서 RandSAC는 대조 기반 및 마스킹 오토에인코더 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • RandSAC는 MAE나 BEIT과 같은 비순차적 예측 방법보다 ImageNet-1K에서 슈퍼리오어하며, 더 작은 입력 크기(192×192)로 선형 프로빙 정확도 72.3%와 파인튜닝 정확도 83.7%를 달성한다.
  • CIFAR-10과 CIFAR-100에서 각각 93.9%와 96.9%의 선형 프로빙 정확도를 기록하며, 저데이터 사전 훈련 환경에서 감독 학습 DeiT-B와 다른 자기지도 방법을 능가한다.
  • 무작위로 순서가 정렬된 세그먼트 사용은 래스터 순서 대비 성능 향상을 크게 개선하며, 암묵적 데이터 증강으로서의 효과를 입증한다.
  • 제안된 디코더 내 학습 가능한 스킵 커넥션 메커니즘은 모든 벤치마크에서 일관된 성능 향상을 이끌어낸다.
  • 대조 기반 방법(DINO, MoCo v3)과 비교해도 더 작은 이미지 크기와 대조 목적이 없음에도 불구하고 경쟁 가능한 성능을 달성한다.
  • 이 방법은 데이터셋 간 일반화 능력이 뛰어나며, 스케일링 효과도 효과적으로 발휘하며, 정사각형 및 블롭 기반 세그먼트 모두 강력한 성능을 내는 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.