Skip to main content
QUICK REVIEW

[논문 리뷰] Minimum Bayes Risk Training of RNN-Transducer for End-to-End Speech Recognition

Chao Weng, Chengzhu Yu|arXiv (Cornell University)|2019. 11. 28.
Speech Recognition and Synthesis참고 문헌 33인용 수 16
한 줄 요약

이 논문은 엔드 투 엔드 음성 인식에서 RNN-Transducer(RNN-T) 모델을 위한 최소 베이즈 손실(MBR) 훈련을 제안하며, 기준 번역문과 실시간으로 생성된 N-best 가설 간의 기대 편집 거리 최소화를 목표로 한다. 이 방법은 문자 오류율(CER)을 크게 향상시켜, 강력한 컨volution 및 트랜스포머 기반 RNN-T 기준 모델 대비 독서형 중국어 음성에서 1.2%의 절대 감소, 자연스러운 중국어 음성에서 0.5%의 절대 감소를 달성하며, 외부 신경 언어 모델(NNLM)과 병합할 경우 추가로 성능 향상을 이룬다.

ABSTRACT

In this work, we propose minimum Bayes risk (MBR) training of RNN-Transducer (RNN-T) for end-to-end speech recognition. Specifically, initialized with a RNN-T trained model, MBR training is conducted via minimizing the expected edit distance between the reference label sequence and on-the-fly generated N-best hypothesis. We also introduce a heuristic to incorporate an external neural network language model (NNLM) in RNN-T beam search decoding and explore MBR training with the external NNLM. Experimental results demonstrate an MBR trained model outperforms a RNN-T trained model substantially and further improvements can be achieved if trained with an external NNLM. Our best MBR trained system achieves absolute character error rate (CER) reductions of 1.2% and 0.5% on read and spontaneous Mandarin speech respectively over a strong convolution and transformer based RNN-T baseline trained on ~21,000 hours of speech.

연구 동기 및 목표

  • 기대 편집 거리 최소화를 통해 번역 품질을 직접 최적화하는 RNN-T를 위한 사전 훈련 기반의 훈련 방법을 개발한다.
  • 다른 음성 인식 프레임워크에서의 성공에도 불구하고 RNN-T 시스템에서 MBR 훈련의 부재를 해결한다.
  • 빔 서치 디코딩 및 MBR 훈련에 외부 신경 언어 모델(NNLM)을 통합하여 더 높은 내성과 정확도를 확보한다.
  • MBR 훈련과 N-best 가설 생성이 대규모 중국어 음성 데이터셋에서 표준 RNN-T 훈련보다 뛰어난 성능을 낼 수 있음을 입증한다.

제안 방법

  • 안정적인 최적화를 확보하기 위해 사전 훈련된 RNN-T 모델로 MBR 훈련을 초기화한다.
  • 빔 크기가 8인 빔 서치를 사용하여 훈련 중에 N-best 가설을 생성하며, 모델의 출력 분포에서 샘플링한다.
  • 기준 번역문과 N-best 가설 간의 기대 편집 거리를 MBR 목적 함수로 계산한다.
  • 훈련 안정성과 N-best 생성 속도 저하 방지를 위해 MBR 손실과 표준 RNN-T 손실을 정규화된 손실로 조합한다(λ = 1.0).
  • 고정된 조합 가중치 λ = 0.1를 사용하여 로그 확률 조합을 통한 히우리스틱을 도입하여 빔 서치 디코딩 중 외부 NNLM을 통합한다.
  • 외부 NNLM를 함께 또는 별도로 훈련하여 음성 및 언어 모델링 구성 요소를 종합적으로 최적화한다.

실험 결과

연구 질문

  • RQ1MBR 훈련이 RNN-T 모델에 효과적으로 적용되어 자동 음성 인식 성능을 향상시킬 수 있는가?
  • RQ2빔 서치 디코딩 중 외부 신경 언어 모델(NNLM)을 통합하면 MBR 훈련 결과가 향상되는가?
  • RQ3외부 NNLM를 함께 훈련함으로써 MBR 최적화된 RNN-T 모델의 문자 오류율(CER) 감소에 미치는 영향은 무엇인가?
  • RQ4읽기 및 자연스러운 음성 모두에서 MBR 훈련이 표준 RNN-T 훈련 대비 수렴성과 내성 측면에서 어떻게 비교되는가?

주요 결과

  • MBR 훈련된 RNN-T 모델은 강력한 컨볼루션 및 트랜스포머 기반 RNN-T 기준 모델 대비 독서형 중국어 음성 세트에서 1.2%의 절대 CER 감소, 자연스러운 음성 세트에서 0.5%의 절대 CER 감소를 달성한다.
  • 외부 NNLM 없이도 MBR 훈련된 모델는 디코딩 시 외부 NNLM를 사용하는 기준 RNN-T 모델를 뛰어넘는 성능을 보인다.
  • 외부 NNLM를 훈련 및 디코딩 모두에서 사용할 경우, MBR 모델은 독서 세트에서 CER을 5.0% 감소시키고 자연스러운 세트에서는 14.9% 감소시킨다.
  • 디코딩 중에 β = 0.8로 소프트맥스 스무딩을 적용하면 독서 세트의 CER은 6.5%에서 6.2%로, 자연스러운 세트의 CER은 15.6%에서 15.4%로 감소한다.
  • 얕은 융합을 통한 외부 NNLM 사용은 기준 RNN-T 모델에 적용했을 때 독서 세트에서 CER을 0.5% 감소시키고 자연스러운 세트에서는 0.1% 감소시킨다.
  • 표준 RNN-T 손실과 MBR 손실을 정규화하여 조합함으로써(λ = 1.0) N-best 생성 속도 저하를 방지하고 훈련 효율성을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.