Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Speech Recognition

Alexei Baevski, Wei-Ning Hsu|arXiv (Cornell University)|2021. 05. 24.
Speech Recognition and Synthesis참고 문헌 111인용 수 21
한 줄 요약

이 논문은 자가학습된 wav2vec 2.0 표현을 활용하여 비감독 학습된 음성 인식을 위한 wav2vec-U 프레임워크를 소개한다. 이는 레이블이 없는 음성 데이터를 분할하고, 이를 적대적 훈련을 통해 음소로 매핑한다. TIMIT에서 11.3%의 음소 오류율과 Librispeech test-other에서 5.9%의 단어 오류율을 기록하며, 960시간의 레이블된 데이터로 훈련된 감독 학습 시스템과 견줄 만큼 높은 성능을 보이며, 저자원 언어를 포함한 다양한 언어에서 강력한 성능을 입증한다.

ABSTRACT

Despite rapid progress in the recent past, current speech recognition systems still require labeled training data which limits this technology to a small fraction of the languages spoken around the globe. This paper describes wav2vec-U, short for wav2vec Unsupervised, a method to train speech recognition models without any labeled data. We leverage self-supervised speech representations to segment unlabeled audio and learn a mapping from these representations to phonemes via adversarial training. The right representations are key to the success of our method. Compared to the best previous unsupervised work, wav2vec-U reduces the phoneme error rate on the TIMIT benchmark from 26.1 to 11.3. On the larger English Librispeech benchmark, wav2vec-U achieves a word error rate of 5.9 on test-other, rivaling some of the best published systems trained on 960 hours of labeled data from only two years ago. We also experiment on nine other languages, including low-resource languages such as Kyrgyz, Swahili and Tatar.

연구 동기 및 목표

  • 번역된 학습 데이터가 전혀 없는 조건에서도 작동하는 음성 인식 시스템을 개발함으로써, 저자원 언어 및 다수 언어에 대한 음성 기술을 가능하게 한다.
  • 현재의 음성 인식 시스템이 대규모 레이블된 데이터를 필요로 하는 한계를 극복하기 위해 자가학습 미리훈련과 비감독 적응을 활용한다.
  • 고품질의 자가학습 표현이 비감독 음성 인식에 성공하는 데 핵심적임을 입증한다.
  • 레이블이 없는 개발 세트에 접근할 수 없는 상황에서 모델 개발을 안내하기 위해 비감독 교차검증 메트릭을 도입한다.
  • Kyrgyz, Swahili, Tatar와 같은 저자원 언어를 포함한 다양한 언어에서 방법을 평가하여 일반화 및 확장성 여부를 점검한다.

제안 방법

  • 메서드는 원시적이고 레이블이 없는 음성 오디오에서 wav2vec 2.0을 사용해 자가학습 표현을 추출한다.
  • 잠재 표현에 k-means 군집화를 적용하여 오디오를 단위로 분할하고, 평균 풀링 및 주성분 분석(PCA)을 통해 세그먼트 수준의 표현을 생성한다.
  • 소형 생성망(약 90,000개의 파라미터)이 이러한 세그먼트 표현을 예측된 음소 시퀀스로 매핑한다.
  • 생성망과 음소화된 텍스트를 구분하는 판별망 간의 적대적 훈련을 시행한다.
  • 프레임워크는 재구성 오차와 군집 일관성 기반의 비감독 검증 메트릭을 포함하여 하이퍼파라미터 튜닝과 조기 정지에 도움을 준다.
  • 모델은 레이블이 없는 오디오와 텍스트만을 사용해 엔드 투 엔드로 훈련되며, 음소화는 외부 도구를 통해 수행된다.

실험 결과

연구 질문

  • RQ1자기학습된 음성 표현은 번역된 데이터가 전혀 없는 조건에서 효과적인 비감독 음성 인식을 가능하게 할 수 있는가?
  • RQ2자기학습 표현의 품질이 비감독 ASR 시스템 성능에 어떤 영향을 미치는가?
  • RQ3감독 학습 없이 생성망과 판별망 간의 적대적 훈련이 음소 정렬을 향상시킬 수 있는가?
  • RQ4이 프레임워크는 저자원 언어 및 영어 외 언어로까지 얼마나 잘 일반화되는가?
  • RQ5레이블이 없는 개발 데이터가 없더라도 비감독 메트릭이 모델 개발과 하이퍼파라미터 선택을 신뢰성 있게 안내할 수 있는가?

주요 결과

  • wav2vec-U는 TIMIT 벤치마크에서 이전 최고의 비감독 방법이 기록한 26.1%의 음소 오류율에서 11.3%로 감소시켜 뚜렷한 향상을 보였다.
  • 더 큰 Librispeech test-other 데이터셋에서 모델은 5.9%의 단어 오류율을 기록했으며, 두 해 전의 960시간 레이블된 데이터로 훈련된 감독 학습 시스템과 견줄 만큼의 성능을 보였다.
  • 이 방법은 영어 외 저자원 언어인 Kyrgyz, Swahili, Tatar 포함 총 9개 언어로 일반화되었으며, 영어 외 고성능 언어 외에도 적용 가능함을 입증했다.
  • 절단 실험 결과, 군집화, PCA, 다단계 평균 풀링이 필수 요소임을 확인했으며, 이들을 제거할 경우 수렴 실패가 발생했다.
  • 768차원 PCA를 사용할 경우 오류율이 28.0%로 증가하는 반면, 256차원일 경우 22.3%로 낮아져 차원 감소의 최적화가 매우 중요함을 시사한다.
  • 비감독 교차검증 메트릭은 레이블이 없는 데이터에서 하이퍼파라미터 튜닝에 효과적인 모델 선택과 조기 정지를 가능하게 하였으며, 768차원 PCA 절단 실험에서 90% 수렴률을 기록하여 레이블이 없는 환경에서의 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.