Skip to main content
QUICK REVIEW

[논문 리뷰] A Framework for Contrastive and Generative Learning of Audio Representations.

Prateek Verma, Julius O. Smith|arXiv (Cornell University)|2020. 10. 22.
Music and Audio Processing참고 문헌 17인용 수 6
한 줄 요약

이 논문은 레이블이 전혀 없는 음성 표현 학습을 위한 자기지도 학습 프레임워크를 제안한다. 대조적이고 생성적 학습을 결합하여, 음성 증강을 통해 유사한 시각을 대조적으로 임bedding하고, 이산 음성 토큰 위에서 트랜스포머를 학습시켜 생성 모델링을 수행한다. 이로써 최종 작업에서 완전히 지도 학습 방법에 가까운 성능을 달성한다.

ABSTRACT

In this paper, we present a framework for contrastive learning for audio representations, in a self supervised frame work without access to any ground truth labels. The core idea in self supervised contrastive learning is to map an audio signal and its various augmented versions (representative of salient aspects of audio like pitch, timbre etc.) to a space where they are close together, and are separated from other different signals. In addition we also explore generative models based on state of the art transformer based architectures for learning latent spaces for audio signals, without access to any labels. Here, we map audio signals on a smaller scale to discrete dictionary elements and train transformers to predict the next dictionary element. We only use data as a method of supervision, bypassing the need of labels needed to act as a supervision for training the deep neural networks. We then use a linear classifier head in order to evaluate the performance of our models, for both self supervised contrastive and generative transformer based representations that are learned. Our system achieves considerable performance, compared to a fully supervised method, with access to ground truth labels to train the neural network model. These representations, with avail-ability of large scale audio data show promise in various tasks for audio understanding tasks

연구 동기 및 목표

  • 지식 기반 레이블에 접근할 수 없는 자기지도 학습 프레임워크를 개발하는 것.
  • 동일한 음성의 증강된 시각을 공유된 임베딩 공간으로 매핑함으로써 대조 학습을 탐색하는 것.
  • 이산 음성 토큰 위에서 트랜스포머 기반 아키텍처를 사용하여 잠재 공간 학습을 위한 생성 모델링을 조사하는 것.
  • 하류 작업에서 선형 분류기 헤드를 사용하여 학습된 표현을 평가하는 것.
  • 자기지도 학습된 음성 표현이 완전히 지도 학습 모델의 성능을 따라할 수 있음을 보여주는 것.

제안 방법

  • 동일한 음성 샘플의 여러 증강된 시각을 생성하고, 이들의 임베딩 공간에서 대조 손실을 최소화함으로써 대조 학습을 적용한다.
  • 원시 음성을 더 작은 이산 토큰 집합으로 매핑하는 이산 오토에코딩 방법을 사용하여 생성 모델링을 위한 코드북을 형성한다.
  • 트랜스포머 모델이 이산 음성 토큰의 시퀀스에서 다음 토큰을 예측하도록 훈련시켜 계층적인 표현을 학습한다.
  • 하류 분류 작업에서 선형 분류기 헤드를 사용하여 학습된 표현을 평가한다.
  • 대규모 음성 데이터를 유일한 감독 소스로 활용하여 인간에 의한 레이블링이 필요 없도록 한다.
  • 학습된 표현의 품질을 향상시키기 위해 대조적이고 생성적 목표를 모두 조합한다.

실험 결과

연구 질문

  • RQ1레이블 없이도 대조 자기지도 학습이 의미 있는 음성 표현을 효과적으로 학습할 수 있는가?
  • RQ2이산 음성 토큰 위에서 트랜스포머 기반 생성 모델링이 경쟁 가능한 표현을 생성할 수 있는가?
  • RQ3대조적이고 생성적 목표의 조합이 표현 품질을 어떻게 향상시키는가?
  • RQ4자기지도 학습된 음성 표현이 완전히 지도 학습 모델의 성능을 어느 정도 따라할 수 있는가?
  • RQ5대규모 음성 데이터가 자기지도 표현 학습에 어떤 영향을 미치는가?

주요 결과

  • 제안된 대조 학습 프레임워크는 동일 음성의 증강된 시각을 임베딩 공간 내 공유 영역으로 성공적으로 매핑하여 표현 품질을 향상시킨다.
  • 이산 음성 토큰 위에서 훈련된 생성 트랜스포머 모델은 음성 신호의 의미 있는 순차적 종속성을 학습한다.
  • 대조적이고 생성적 목표의 조합은 더 견고하고 일반화 능력이 뛰어난 음성 표현을 이끈다.
  • 자기지도 학습 표현에 적용된 선형 분류기 헤드는 완전히 지도 학습 모델과 비교할 만한 성능을 달성한다.
  • 이 프레임워크는 오직 대규모 레이블이 없는 음성 데이터만을 사용하여도 음성 이해 작업에 강력한 잠재력을 보여준다.
  • 결과는 대규모 데이터를 활용한 자기지도 학습이 고비용 레이블링에 대한 의존도를 크게 줄일 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.