Skip to main content
QUICK REVIEW

[논문 리뷰] Position Prediction as an Effective Pretraining Strategy

Shuangfei Zhai, Navdeep Jaitly|arXiv (Cornell University)|2022. 07. 15.
Natural Language Processing Techniques인용 수 8
한 줄 요약

이 논문은 이미지나 음성 패치의 내용만으로 위치를 예측하도록 훈련하는 새로운 자기지도 학습 전훈 방법인 MP3(Masked Patch Position Prediction)를 제안한다. 이 방법은 위치 임베딩을 사용하지 않으며, 최신 자기지도 학습 방법과 유사한 성능을 달성하고, 위치 임베딩이 없는 모델이 시각 및 음성 벤치마크에서 지도 학습 기반 모델을 초월한다.

ABSTRACT

Transformers have gained increasing popularity in a wide range of applications, including Natural Language Processing (NLP), Computer Vision and Speech Recognition, because of their powerful representational capacity. However, harnessing this representational capacity effectively requires a large amount of data, strong regularization, or both, to mitigate overfitting. Recently, the power of the Transformer has been unlocked by self-supervised pretraining strategies based on masked autoencoders which rely on reconstructing masked inputs, directly, or contrastively from unmasked content. This pretraining strategy which has been used in BERT models in NLP, Wav2Vec models in Speech and, recently, in MAE models in Vision, forces the model to learn about relationships between the content in different parts of the input using autoencoding related objectives. In this paper, we propose a novel, but surprisingly simple alternative to content reconstruction~-- that of predicting locations from content, without providing positional information for it. Doing so requires the Transformer to understand the positional relationships between different parts of the input, from their content alone. This amounts to an efficient implementation where the pretext task is a classification problem among all possible positions for each input token. We experiment on both Vision and Speech benchmarks, where our approach brings improvements over strong supervised training baselines and is comparable to modern unsupervised/self-supervised pretraining methods. Our method also enables Transformers trained without position embeddings to outperform ones trained with full position information.

연구 동기 및 목표

  • 마스킹된 오토에인코더와 같은 복잡한 재구성 목표 함수에 의존도를 줄이는 자기지도 학습 전훈 전략을 개발하는 것.
  • 내용만으로도 위치 이해를 학습할 수 있는지 여부를 조사하는 것.
  • 전훈 단계에서 위치 임베딩을 제거해도 강력한 최종 성능을 달성할 수 있는지 평가하는 것.
  • 내용 재구성과 비교해 위치 예측을 사전 과제로 사용했을 때의 효과를 탐색하는 것.
  • Transformer 모델이 위치 예측만으로도 공간적 또는 시간적 구조에 대한 강력한 인덕티브 바이어스를 학습할 수 있는지 보여주는 것.

제안 방법

  • 각 입력 토큰(예: 이미지 패치 또는 음성 프레임)의 위치를 선형 분류기 헤드를 사용해 예측하도록 모델을 훈련시키며, 위치 예측을 다중 클래스 분류 문제로 간주한다.
  • 전훈 중에는 모든 토큰에서 위치 정보를 제거하고, 랜덤으로 선택된 토큰(컨텍스트 토큰)만을 키와 밸류로 사용한다.
  • 어텐션 메커니즘을 수정하여, 모든 쿼리 토큰이 오직 컨텍스트 토큰의 키와 밸류만을 참조하도록 하여, 부분적인 컨텍스트에서 위치를 추론하도록 유도한다.
  • 훈련 목표는 예측된 위치와 진짜 위치 사이의 교차 엔트로피 손실이며, 픽셀 또는 스펙트럼 값의 재구성은 이루어지지 않는다.
  • 전훈 후에는 위치 예측 헤드를 제거하고, 최종 작업 헤드(예: 분류)로 교체하며, 미세조정 단계에서 절대 위치 임베딩을 추가한다.
  • 이 방법은 일관된 성능 향상을 보이며, 시각(ImageNet, CIFAR) 및 음성(Google Speech Commands) 벤치마크에 모두 적용된다.

실험 결과

연구 질문

  • RQ1Transformer 모델이 위치에 대한 지식을 완전히 내용만으로 학습할 수 있는가? 즉, 위치에 대한 명시적 지도 없이도 입력 토큰 간의 위치 관계를 이해할 수 있는가?
  • RQ2위치 예측을 사전 과제로 사용했을 때, 마스킹된 재구성과 비교해 최종 성능 및 효율성 측면에서 어떤가?
  • RQ3위치 임베딩 없이 전훈한 Transformer가, 위치 예측을 통해 전훈한 모델보다 성능이 뛰어나게 될 수 있는가?
  • RQ4비디오 데이터와 음성 데이터 간의 위치 예측 과제 난이도는 어떻게 다를지, 그리고 부분적인 위치 지도 정보가 성능에 어떤 영향을 미치는가?
  • RQ5MP3는 어떤 인덕티브 바이어스를 학습하는가? 그리고 추론 과정에서 어텐션 패턴은 이를 어떻게 반영하는가?

주요 결과

  • ImageNet-1K 벤치마크에서 MP3는 ViT-Base 모델을 사용해 80.2%의 top-1 정확도를 달성했으며, 지도 학습 기반 모델을 뛰어넘고 최신 자기지도 학습 방법과 유사한 성능을 보였다.
  • Google Speech Commands 데이터셋에서 MP3는 테스트 정확도를 지도 학습 기반 모델의 91.9%에서 94.2%로 향상시켜 2.3%p의 절대적 향상을 이뤘으며, 위치 정보가 제공되는 패치 비율이 5%에 불과한 상황에서도 성능 향상을 달성했다.
  • 모든 패치가 가시한 경우, 시각 데이터에서 MP3는 위치 예측 정확도가 거의 완벽한 98.7%에 도달했으며, 이는 공간적 관계를 강력하게 학습할 수 있음을 시사한다.
  • 전훈 단계에서 위치 임베딩을 사용하지 않았음에도 불구하고, 깊은 층(예: 레이어 6, 10, 11)에서 강력한 국소화 패턴이 학습된 것으로 나타나, 내용만으로도 암묵적인 위치 이해가 유도됨을 시사한다.
  • 오직 컨텍스트 토큰만을 키와 밸류로 사용하는 희소 어텐션을 적용해 전훈의 계산 비용을 줄였으며, 전체 어텐션보다 효율적이다.
  • MP3 전훈 후에 미세조정을 수행한 결과, 전체 위치 임베딩을 사용한 지도 학습 전훈보다도 더 높은 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.