Skip to main content
QUICK REVIEW

[논문 리뷰] An Exploration of Self-Supervised Pretrained Representations for End-to-End Speech Recognition

Xuankai Chang, Takashi Maekaku|arXiv (Cornell University)|2021. 10. 09.
Speech Recognition and Synthesis인용 수 8
한 줄 요약

이 논문은 HuBERT와 Wav2Vec2.0를 포함한 자기지도 학습 사전 훈련된 음성 표현을, 최신 모델인 트랜스포머와 컨포머를 사용한 엔드 투 엔드 음성 인식(E2E-ASR) 시스템 내에서 평가한다. 모델 아키텍처나 훈련 전략을 수정하지 않고도, 여러 공개 ASR 코퍼스에서 최고 성능 또는 그에 준하는 성능을 달성하여 강력한 일반화 능력과 빠른 수렴 능력을 입증한다.

ABSTRACT

Self-supervised pretraining on speech data has achieved a lot of progress. High-fidelity representation of the speech signal is learned from a lot of untranscribed data and shows promising performance. Recently, there are several works focusing on evaluating the quality of self-supervised pretrained representations on various tasks without domain restriction, e.g. SUPERB. However, such evaluations do not provide a comprehensive comparison among many ASR benchmark corpora. In this paper, we focus on the general applications of pretrained speech representations, on advanced end-to-end automatic speech recognition (E2E-ASR) models. We select several pretrained speech representations and present the experimental results on various open-source and publicly available corpora for E2E-ASR. Without any modification of the back-end model architectures or training strategy, some of the experiments with pretrained representations, e.g., WSJ, WSJ0-2mix with HuBERT, reach or outperform current state-of-the-art (SOTA) recognition performance. Moreover, we further explore more scenarios for whether the pretraining representations are effective, such as the cross-language or overlapped speech. The scripts, configuratons and the trained models have been released in ESPnet to let the community reproduce our experiments and improve them.

연구 동기 및 목표

  • 자기지도 학습 사전 훈련된 음성 표현(SSLRs)이 고도로 발전한 엔드 투 엔드 ASR 시스템에서의 일반화 능력과 성능을 평가하는 것.
  • 다양한 공개 ASR 코퍼스(예: 독서형 대비 자연스러운 대화, 단일 대상 대비 다중 대상)에서 SSLRs의 성능을 비교하는 것.
  • 다국어 및 겹쳐진 음성 인식과 같은 도전적인 상황에서 SSLRs의 효과성을 탐구하는 것.
  • 커뮤니티 사용을 위해 ESPnet에 스크립트, 설정 파일, 훈련된 모델을 공개하여 재현 가능한 벤치마크를 제공하는 것.

제안 방법

  • S3PRL 툴킷에서 제공하는 SSLRs를 ESPnet의 엔드 투 엔드 음성 처리 프레임워크에 통합하여 원활한 평가를 수행.
  • 동일한 백엔드 모델 아키텍처를 사용하여 다양한 ASR 코퍼스에서 HuBERT, Wav2Vec2.0, APC, Mockingjay, TERA, NPC, VQ-APC 등 여러 SSLR 모델을 평가.
  • 세 가지 특징 융합 전략 탐색: 모든 인코더 레이어의 가중 평균, 마지막 레이어 표현, 미세조정된 마지막 레이어 특징.
  • 고정된 SSLR 특징을 사용하여, joint CTC/attention 기반 트랜스포머 및 컨포머 인코더-디코더 모델을 사용해 엔드 투 엔드 ASR 훈련을 수행.
  • 학습 안정성을 향상시키기 위해 그래디언트 누적, 드롭아웃 정규화, 발화 수준 정규화와 같은 표준 훈련 기법 적용.
  • 훈련 동역학을 모니터링하기 위해 검증 정확도 곡선을 활용하여 SSLR 특징의 수렴성과 강건성 평가.
Fig. 1 : End-to-End speech processing with various speech representations. The framework can be used in speech recognition (ASR), speech translation (ST), speech enhancement (SE), etc.
Fig. 1 : End-to-End speech processing with various speech representations. The framework can be used in speech recognition (ASR), speech translation (ST), speech enhancement (SE), etc.

실험 결과

연구 질문

  • RQ1다양한 코퍼스에서 전통적인 log-Mel FBANK 특징에 비해 자기지도 학습 사전 훈련된 표현은 엔드 투 엔드 ASR 성능에서 어떻게 비교되는가?
  • RQ2HuBERT와 Wav2Vec2.0와 같은 SSLRs는 LibriSpeech를 초월해 다른 오픈소스 ASR 데이터셋에서도 최고 성능을 달성할 수 있는가?
  • RQ3다중 레이어 표현을 최적의 방식으로 활용하는 방법은 무엇인가—가중 평균, 마지막 레이어, 또는 미세조정된 마지막 레이어 특징인가?
  • RQ4다국어 또는 겹쳐진 음성 인식과 같은 도전적인 상황에서 SSLRs는 어떻게 성능을 발휘하는가?

주요 결과

  • HuBERT와 Wav2Vec2.0 표현은 log-Mel FBANK 특징보다 뚜렷하게 뛰어난 성능을 보이며, WSJ, LibriTTS, AISHELL을 포함한 여러 코퍼스에서 최고 또는 최고 수준에 준하는 결과를 달성.
  • WSJ 데이터셋에서 가중 평균 특징을 사용한 HuBERT는 라이트 맵(LM)이 있는 경우 WER 3.0%로, 라이트 맵이 없는 경우 4.9%를 기록하여, FBANK 기반 베이스라인(각각 5.3% 및 5.5%)을 초월.
  • 가중 평균 특징을 사용한 Wav2Vec2.0는 라이트 맵이 있는 경우 WER 3.7%를 기록하여, 이전 최고 성능 시스템과 동등하거나 이를 초월.
  • SSLR 기반 모델의 학습 곡선은 FBANK보다 더 빠른 수렴을 보였으며, HuBERT와 Wav2Vec2.0는 초기 훈련 에포크부터 뛰어난 정확도를 유지.
  • HuBERT 특징는 마지막 레이어에 강하게 집중되어 있는 반면, Wav2Vec2.0는 가중 평균을 통해 다수의 레이어를 융합함으로써 더 풍부한 중간 표현을 확보.
  • 학습률 및 배치 크기와 같은 하이퍼파라미터 변화에 대해도 사전 훈련된 표현이 강건하게 작동하여, 다양한 훈련 환경에서의 신뢰성을 입증.
Fig. 2 : Validation accuracies of different self-supervised learning representations on WSJ ASR dataset.
Fig. 2 : Validation accuracies of different self-supervised learning representations on WSJ ASR dataset.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.