Skip to main content
QUICK REVIEW

[논문 리뷰] data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language

Alexei Baevski, Wei-Ning Hsu|arXiv (Cornell University)|2022. 02. 07.
Domain Adaptation and Few-Shot Learning인용 수 240
한 줄 요약

data2vec는 masked inputs에서 맥락화된 잠재 표현을 예측하는 교사-학생 Transformer 설정을 사용하여 음성, 비전, 언어 간 자가감독 학습을 통합하고 벤치마크에서 경쟁력 있거나 최첨단 성과를 달성합니다.

ABSTRACT

While the general idea of self-supervised learning is identical across modalities, the actual algorithms and objectives differ widely because they were developed with a single modality in mind. To get us closer to general self-supervised learning, we present data2vec, a framework that uses the same learning method for either speech, NLP or computer vision. The core idea is to predict latent representations of the full input data based on a masked view of the input in a self-distillation setup using a standard Transformer architecture. Instead of predicting modality-specific targets such as words, visual tokens or units of human speech which are local in nature, data2vec predicts contextualized latent representations that contain information from the entire input. Experiments on the major benchmarks of speech recognition, image classification, and natural language understanding demonstrate a new state of the art or competitive performance to predominant approaches.

연구 동기 및 목표

  • 음성, 비전, 언어 등 여러 모달리티에 적용 가능한 단일 자가감독 학습 프레임워크를 제시한다.
  • 고정된 로컬 타깃이 아니라 맥락화된 잠재 표현을 타깃으로 하는 마스킹 기반 예측 작업을 개발한다.
  • 다수의 교사 계층으로부터 평균화된 잠재 표현을 예측하는 것이 교차 모달 성능을 향상시킨다는 것을 입증한다.
  • 비전(ImageNet), 음성(ASR), NLP(GLUE)에서 주요 벤치마크에 대한 최첨단 또는 경쟁력 있는 결과를 보여준다.
  • 성능에 대한 타깃 계층화, 맥락, 모달리티별 설계 선택의 효과에 대한 인사이트를 제공한다.

제안 방법

  • 표준 Transformer 아키텍처를 교사-학생 모드로 작동시키고, 교사는 학생의 EMA이다.
  • 교사를 사용하여 전체 입력 표현을 타깃으로 인코딩하고; 마스크된 입력을 학생으로 인코딩하여 해당 타깃을 예측한다.
  • 마스킹된 시간 스텝에 대해 상위 K 개의 교사 블록으로부터 정규화된 표현을 평균화하여 타깃을 구성한다.
  • 마스크된 예측으로부터 맥락화된 타깃을 회귀하기 위해 Smooth L1 손실로 학습한다.
  • 각 모달리티에 맞게 모달리티별 입력 인코더와 마스킹 전략(비전 패치, 음성 스팬, 단어/서브워드 마스킹)을 사용한다.
  • ImageNet, Librispeech, 및 GLUE 스타일 벤치마크에서 두 가지 모델 크기(Base, Large)를 평가한다.

실험 결과

연구 질문

  • RQ1단일 자가감독 학습 목적이 모달리티 특화 타깃 없이 비전, 음성, 언어 전반에 걸쳐 효과적일 수 있는가?
  • RQ2맥락화된 잠재 타깃과 다층 타깃 평균화가 모달리티 전반의 다운스트림 성능을 향상시키는가?
  • RQ3맥락 크기와 타깃 특징 선택이 학습 및 다운스트림 작업으로의 전이에 어떤 영향을 미치는가?
  • RQ4데이터2vec 접근 방식이 각 모달리티의 표준 벤치마크에서 최첨단 또는 경쟁력 있는 결과를 낳는가?

주요 결과

  • Data2vec는 비전, 음성, 언어의 주요 벤치마크에서 경쟁력 있거나 최첨단 결과를 달성한다.
  • 맥락화된 잠재 표현을 예측하고 다수의 교사 층을 평균화하는 것이 단일 최상위 층 표현을 예측하는 것보다 다운스트림 정확도를 더 좋게 만드는 경우가 많다, 모든 모달리티에서.
  • 맥락화된 타깃은 최고의 성능을 위해 전체 입력 맥락이 필요하다; 교사의 맥락을 제한하면 결과가 저하된다.
  • 타깃으로 self-attention 출력이 아닌 FFN 출력을 사용하는 것이 음성 사전학습에 더 나은 성능을 보이는 경향이 있다.
  • 통합 프레임워크는 NLP에서 단어 같은 이산 타깃 토큰에 의존하지 않고도 강력한 성능을 가능하게 하며, 여전히 비전과 음성에서도 견고한 결과를 제공합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.