Skip to main content
QUICK REVIEW

[논문 리뷰] Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages

Yu Zhang, Wei Han|arXiv (Cornell University)|2023. 03. 02.
Speech Recognition and Synthesis인용 수 112
한 줄 요약

Universal Speech Model (USM)은 방대한 비표기 다국어 데이터와 한정된 표기 데이터로 학습된 대규모 다국어 ASR 시스템으로, ASR 및 음성 번역 작업에서 100개가 넘는 언어에 걸쳐 최신의 최첨단 성능을 달성하고, YouTube 자막 처리에서 강력한 성능과 장문 디코딩의 강건성을 보인다.

ABSTRACT

We introduce the Universal Speech Model (USM), a single large model that performs automatic speech recognition (ASR) across 100+ languages. This is achieved by pre-training the encoder of the model on a large unlabeled multilingual dataset of 12 million (M) hours spanning over 300 languages, and fine-tuning on a smaller labeled dataset. We use multilingual pre-training with random-projection quantization and speech-text modality matching to achieve state-of-the-art performance on downstream multilingual ASR and speech-to-text translation tasks. We also demonstrate that despite using a labeled training set 1/7-th the size of that used for the Whisper model, our model exhibits comparable or better performance on both in-domain and out-of-domain speech recognition tasks across many languages.

연구 동기 및 목표

  • 수백 개의 언어와 도메인을 포괄하는 보편적 ASR 모델을 구축하는 것을 목표로 한다.
  • 대규모의 비표기 다국어 오디오 및 텍스트 데이터를 활용해 강력한 인코더를 프리-트레이닝하고, 미리 라벨링된 데이터셋은 적은 규모로 파인튜닝을 수행한다.
  • ASR 및 AST 작업 전반에서 높은 성능을 가능하게 하는 확장 가능한 학습 및 파인튜닝 파이프라인을 개발한다.
  • SpeechStew, FLEURS, CORAAL, 및 CoVoST 2와 같은 벤치마크에서 최첨단 결과를 입증한다.

제안 방법

  • Conformer 인코더 백본(600M 및 2B 파라미터 변형)을 사용한다.
  • YT-NTL-U로 표기된 12M 시간의 비표기 YouTube 다국어 데이터를 이용해 BEST-RQ (random-projection quantizer)로 인코더를 프리-train 한다.
  • MOST (multi-objective supervised pre-training)를 적용해 BEST-RQ를 text-injection 및 지도 손실과 결합하여 비표기 음성, 비표기 텍스트, 그리고 음성-텍스트 페어 데이터에 걸쳐 학습한다.
  • 라벨링된 데이터(YT-SUP+ 및 Pub-S)에서 지도 학습 ASR 타깃(CTC 및 LAS)을 훈련한다.
  • 구조적 단위의 어텐션(chunk-wise attention)을 활용해 대규모에서 강건한 장문 ASR을 가능하게 하며, 디코더로는 CTC, LAS, 또는 RNN-T를 사용한다.
  • 언어/도메인 적응을 위해 고정된 사전 학습 인코더에 잔차 어댑터(약 2%의 파라미터)를 부착하는 것을 선택적으로 수행한다.
Figure 1: An overview of our approach. Training is split into three stages. (i) The first stage trains a conformer backbone on a large unlabeled speech dataset, optimizing for the BEST-RQ objective. (ii) We continue training this speech representation learning model while optimizing for multiple obj
Figure 1: An overview of our approach. Training is split into three stages. (i) The first stage trains a conformer backbone on a large unlabeled speech dataset, optimizing for the BEST-RQ objective. (ii) We continue training this speech representation learning model while optimizing for multiple obj

실험 결과

연구 질문

  • RQ1제한된 라벨링 데이터로 100개가 넘는 언어에 대해 ASR 및 AST에서 경쟁력 있거나 더 우수한 성능을 단일 대형 다국어 모델이 달성할 수 있는가?
  • RQ2비표기 오디오, 비표기 텍스트, 페어 데이터를 결합한 다단계 프리트레이닝(BEST-RQ, MOST)이 다운스트림 다국어 작업에 얼마나 효과적인가?
  • RQ3청크-와이즈 어텐션이 세그먼트 기반 디코딩과 비교하여 허위 생성 없이 장문 ASR을 가능하게 하는가?
  • RQ4다수 언어에 대해 어댑터 기반 파인튜닝과 전체 모델 파인튜닝의 영향은 무엇인가?

주요 결과

  • USM은 SpeechStew, FLEURS, CORAAL, 및 CoVoST 2에서 다양한 언어와 도메인에 걸쳐 새로운 최첨단 결과를 확립한다.
  • YouTube 자막 작성(73개 언어)에 대해 USM은 지정된 설정에서 30% 미만의 WER를 달성한다.
  • 2B-parameter USM 모델은 90k 시간의 지도 데이터로 훈련되어 Whisper(>400k 시간 데이터로 학습)보다 선택된 언어와 작업에서 더 나은 성능을 내는 것으로 나타났다.
  • MOST (BEST-RQ + text-injection)는 새로운 도메인에 대한 강력한 적응을 가능하게 한다; 어댑터는 고정된 인코더에 약 2%의 파라미터를 추가하는 데 불과하며 여전히 경쟁력 있는 결과를 제공한다.
  • Chunk-wise attention은 장문 ASR 저하를 완화하여 긴 발화에 대해 강건한 기록을 생성한다.
Figure 2: (Left) † WERs (%) Our language expansion effort to support more languages on YouTube (73 languages) and extending to 100+ languages on the public dataset (FLEURS). Lower is better. To the best of our knowledge, no published model can successfully decode all 73 languages from our YouTube se
Figure 2: (Left) † WERs (%) Our language expansion effort to support more languages on YouTube (73 languages) and extending to 100+ languages on the public dataset (FLEURS). Lower is better. To the best of our knowledge, no published model can successfully decode all 73 languages from our YouTube se

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.