Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual sequence-to-sequence speech recognition: architecture, transfer learning, and language modeling

Jaejin Cho, Murali Karthick Baskar|arXiv (Cornell University)|2018. 10. 04.
Speech Recognition and Synthesis참고 문헌 18인용 수 5
한 줄 요약

이 논문은 전이 학습과 다국어 RNN 언어 모델링을 활용한 공동 CTC-어텐션 훈련을 통한 다국어 시퀀스-투-시퀀스(SEQ2SEQ) 음성 인식(ASR) 시스템을 제안한다. 사전에 훈련된 다국어 모델을 저자원 대상 언어에 대해 미세조정함으로써 WER(오류율) 향상이 뚜렷하게 이루어지며, RNNLM 통합은 훈련 데이터를 두 배로 늘인 것과 동등한 성능 향상을 제공한다. 특히 저자원 환경에서 뚜렷한 효과를 보인다.

ABSTRACT

Sequence-to-sequence (seq2seq) approach for low-resource ASR is a relatively new direction in speech research. The approach benefits by performing model training without using lexicon and alignments. However, this poses a new problem of requiring more data compared to conventional DNN-HMM systems. In this work, we attempt to use data from 10 BABEL languages to build a multi-lingual seq2seq model as a prior model, and then port them towards 4 other BABEL languages using transfer learning approach. We also explore different architectures for improving the prior multilingual seq2seq model. The paper also discusses the effect of integrating a recurrent neural network language model (RNNLM) with a seq2seq model during decoding. Experimental results show that the transfer learning approach from the multilingual model shows substantial gains over monolingual models across all 4 BABEL languages. Incorporating an RNNLM also brings significant improvements in terms of %WER, and achieves recognition performance comparable to the models trained with twice more training data.

연구 동기 및 목표

  • 공동 CTC-어텐션 프레임워크 내에서 저자원 대상 언어에 대해 다국어 SEQ2SEQ 모델에서의 전이 학습을 조사한다.
  • 인식 정확도 향상을 위해 디코딩 중 다국어 RNNLM 통합의 효과를 평가한다.
  • 모델 아키텍처와 데이터 크기가 다양한 저자원 언어에서 전이 학습 성능에 미치는 영향을 분석한다.
  • WER 및 CER 향상에 초점을 맞춰 다국어 전이 학습과 단일 언어 훈련을 비교한다.

제안 방법

  • 10개의 BABEL 언어에서 CTC와 어텐션의 선형 보간 가중치 λ를 사용한 다목적 손실을 조합하여 공통 CTC-어텐션 SEQ2SEQ 모델을 훈련한다.
  • 에코더는 양방향 LSTM 또는 깊은 CNN을 사용한 후 BLSTM을 적용하여 음향 특징을 추출하며, CTC 및 어텐션 목표 모두에 대해 공유된 에코더 가중치를 사용한다.
  • 전이 학습은 단계 2 재훈련을 통해 수행되며, 다양한 양의 데이터(5~20시간)를 사용하여 다국어 모델을 대상 언어에 대해 미세조정한다.
  • 각 대상 언어의 텍스트에서 별도로 문자 수준의 RNNLM을 훈련하고, 디코딩 중 얕은 융합을 통해 로그 점수 조합(log p = log p_hyp + β log p_lm) 방식으로 활용한다.
  • 공동 디코딩은 비트 서치를 사용하여 SEQ2SEQ 모델과 RNNLM의 가설을 결합하며, β는 음성 모델 점수와 언어 모델 점수의 균형을 맞추기 위해 튜닝된다.
  • 언어 모델링은 훈련 중이 아니라 추론 중에 사후적으로 적용되어 모델의 유연성을 유지하고 성능 저하를 방지한다.
Fig. 1 : Hybrid attention/CTC network with LM extension: the shared encoder is trained by both CTC and attention model objectives simultaneously. The joint decoder predicts an output label sequence by the CTC, attention decoder and RNN-LM.
Fig. 1 : Hybrid attention/CTC network with LM extension: the shared encoder is trained by both CTC and attention model objectives simultaneously. The joint decoder predicts an output label sequence by the CTC, attention decoder and RNN-LM.

실험 결과

연구 질문

  • RQ110개의 BABEL 언어에서 사전 훈련된 다국어 SEQ2SEQ 모델을 4개의 새로운 저자원 대상 언어에 대해 전이 학습을 통해 효과적으로 미세조정할 수 있는가?
  • RQ2다양한 데이터 크기에서 디코딩 중 다국어 RNNLM 통합이 인식 성능에 미치는 영향은 어떠한가?
  • RQ3저자원 ASR에서 WER 감소에 있어 전이 학습과 언어 모델링의 상대적 기여는 무엇인가?
  • RQ4RNNLM 통합의 성능 향상은 사용 가능한 훈련 데이터의 양에 따라 비례하는가, 아니면 저자원 환경에서 가장 효과적인가?

주요 결과

  • 다국어 사전 모델에서의 전이 학습은 모든 4개의 대상 언어에서 평균 6%의 WER 감소를 이끌었으며, 데이터 크기와 관계없이 일관된 성능 향상을 보였다.
  • 디코딩 중 다국어 RNNLM을 통합함으로써 평균적으로 WER가 약 6% 감소했으며, 특히 저자원 환경(예: 5시간 데이터)에서 가장 큰 향상이 관찰되었다.
  • 아삼계어의 경우, 5시간 데이터에서 RNNLM 디코딩을 통한 WER 향상 수준이 20시간 데이터로 재훈련한 모델의 성능과 동일했으며, 이는 데이터 효율성을 입증한다.
  • 단계 2 재훈련과 RNNLM 통합의 조합은 아삼계어에서 WER 65.3%, 타갈로그어에서 64.3%, 스포아시어에서 56.2%, 라오어에서 57.9%를 달성했으며, 이는 두 배의 데이터로 훈련한 모델과 유사한 성능을 보였다.
  • RNNLM은 전이 학습에서 사용된 대상 데이터의 양에 관계없이 일관된 WER 향상을 제공했으며, 자원 부족 상황에서도 안정성을 입증했다.
  • 다국어 사전 훈련과 RNNLM 디코딩을 통한 공동 CTC-어텐션 모델은 단일 언어 모델과 독립적인 SEQ2SEQ 시스템을 모두 초월했으며, 다양한 저자원 언어에 대해 강력한 일반화 능력을 보였다.
Fig. 2 : Difference in performance for 5 hours, 10 hours, 20 hours and full set of target language data used to retrain a multilingual model from stage-1
Fig. 2 : Difference in performance for 5 hours, 10 hours, 20 hours and full set of target language data used to retrain a multilingual model from stage-1

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.