Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer based unsupervised pre-training for acoustic representation learning

Ruixiong Zhang, Haiwei Wu|arXiv (Cornell University)|2020. 07. 29.
Music and Audio Processing참고 문헌 24인용 수 7
한 줄 요약

이 논문은 15%의 음성 특징 블록을 마스킹하고 왼쪽 및 오른쪽 컨텍스트를 사용해 복원함으로써 일반적이고 강건한 음향 표현을 학습하는 Transformer 기반의 비지도 사전학습 방법을 제안한다. 다양한 데이터셋(Librispeech, MuST-C, ESC-US)에서의 사전학습은 음성 정서 인식, 사운드 이벤트 검출, 음성 번역 등 다양한 작업에서 성능을 크게 향상시키며, 각각 UAR에서 4.3%p, F1에서 1.5–2.1%p, BLEU 점수에서 상대적 향상률이 12.2%와 8.4%를 기록한다.

ABSTRACT

Recently, a variety of acoustic tasks and related applications arised. For many acoustic tasks, the labeled data size may be limited. To handle this problem, we propose an unsupervised pre-training method using Transformer based encoder to learn a general and robust high-level representation for all acoustic tasks. Experiments have been conducted on three kinds of acoustic tasks: speech emotion recognition, sound event detection and speech translation. All the experiments have shown that pre-training using its own training data can significantly improve the performance. With a larger pre-training data combining MuST-C, Librispeech and ESC-US datasets, for speech emotion recognition, the UAR can further improve absolutely 4.3% on IEMOCAP dataset. For sound event detection, the F1 score can further improve absolutely 1.5% on DCASE2018 task5 development set and 2.1% on evaluation set. For speech translation, the BLEU score can further improve relatively 12.2% on En-De dataset and 8.4% on En-Fr dataset.

연구 동기 및 목표

  • 레이블이 부족한 음향 작업에서 일반적이고 강건한 표현을 비지도 사전학습을 통해 학습함으로써 도전 과제를 해결하고자 한다.
  • 다양한 음성 데이터에서 학습한 단일 통합 표현이 여러 음향 작업에서 성능 향상에 기여하는지 탐구하고자 한다.
  • 번역된 데이터에 의존하지 않고도 넓은 산업적 적용이 가능한 간단하면서도 효과적인 사전학습 체계를 개발하고자 한다.
  • Transformer 인코더에서 마스킹 복원을 통한 자체지도 사전학습이 최종 작업에서 지도 학습 기반 모델과 경쟁하거나 승승을 거두는지 입증하고자 한다.

제안 방법

  • 15%의 음성 특징 블록(각각 N프레임 포함)이 0으로 마스킹된 Transformer 기반 인코더를 마스킹 자동에코딩 목적을 사용해 사전학습한다.
  • 모델은 마스킹된 블록을 오직 마스킹되지 않은 왼쪽 및 오른쪽 컨텍스트 특징만을 사용해 복원하며, 프레임 수준 예측에 대한 L1 손실을 통해 훈련된다.
  • 인코더의 CNN 모듈이 유도하는 다운샘플링 효과를 고려해 개별 프레임이 아닌 전체 N프레임 블록을 마스킹함으로써 마스킹 메커니즘을 설계한다.
  • 사전학습 후에는 작업별 디코더를 추가하고, 음성 정서 인식, 사운드 이벤트 검출, 음성 번역 등의 최종 작업을 위해 전체 모델을 엔드 투 엔드로 미세조정한다.
  • 사전학습 데이터는 Librispeech, MuST-C, ESC-US 데이터셋을 조합하여 음성 및 비음성 음향에 대한 표현 일반화를 향상시킨다.
  • 표준 Transformer 아키텍처를 사용하며, 멀티헤드 자기주의 어텐션과 피드포워드 레이어를 포함하고, Adam 옵timizer와 학습률 스케줄링을 사용해 훈련한다.
Fig. 1 : training structure and procedure: (a) The structure of Transformer based encoder. (b) Pre-training: it is trained to predict the masked acoustic feature using L1 loss. (c) Fine-tuning: the pre-trained transformer encoder is fine-tuned with an additional decoder layer to adapt to the specifi
Fig. 1 : training structure and procedure: (a) The structure of Transformer based encoder. (b) Pre-training: it is trained to predict the masked acoustic feature using L1 loss. (c) Fine-tuning: the pre-trained transformer encoder is fine-tuned with an additional decoder layer to adapt to the specifi

실험 결과

연구 질문

  • RQ1비지도 사전학습을 통해 학습된 단일 통합 음향 표현이 다양한 음향 작업에서 성능 향상에 기여할 수 있는가?
  • RQ2음성과 환경 음향 데이터의 조합에서 사전학습을 수행할 경우, 음성 정서 인식, 사운드 이벤트 검출, 음성 번역 작업의 최종 성능에 어떤 영향을 미치는가?
  • RQ3마스킹 복원을 통한 비지도 사전학습이 종단간 음성 번역에서 지도 학습 기반 방법보다 우수하거나 동등한 성능을 내는 데까지 어느 정도 기여하는가?
  • RQ4제안된 방법이 CPC나 APC와 같은 기존 자기지도 학습 접근법보다 비음성 음향 작업에서 더 잘 일반화되는가?

주요 결과

  • IEMOCAP 데이터셋에서 OpenAudio 데이터로의 사전학습은 기본 Transformer 대비 무게화되지 않은 정확도율(UAR)을 4.3%p 향상시켰다.
  • DCASE2018 Task5 사운드 이벤트 검출에서, OpenAudio 사전학습을 통해 개발 세트에서 F1 점수가 1.5%p, 평가 세트에서 2.1%p 향상되었다.
  • MuST-C En-De 번역 작업에서 BLEU 점수는 기본 Transformer 대비 12.2% 상대적 향상률을 기록했으며, En-Fr 작업에서는 8.4% 향상되었다.
  • 레이블이 없는 텍스트 전사 자료 없이도, ASR 사전학습을 활용한 최신 기준 시스템과 비교해 유사하거나 뛰어난 성능을 달성했다.
  • 수작업 특징과 데이터 증강을 사용한 시스템을 포함한 여러 강력한 백본 시스템보다 사운드 이벤트 검출에서 뛰어난 성능을 보였다.
  • 결과적으로, Transformer 인코더에서 마스킹 복원을 통한 비지도 사전학습이 다양한 음향 작업으로 이식 가능한 일반적이고 강건한 표현을 생성함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.