Skip to main content
QUICK REVIEW

[논문 리뷰] Transfer learning of language-independent end-to-end ASR with language model fusion

Hirofumi Inaguma, Jaejin Cho|arXiv (Cornell University)|2018. 11. 06.
Speech Recognition and Synthesis참고 문헌 19인용 수 6
한 줄 요약

이 논문은 외부 언어 모델을 사전에 훈련된 언어 독립형 엔드 투 엔드 ASR 시스템의 디코더에 통합하여 저자원 언어에 적응하는 동안 언어 모델 융합 전이(LM fusion transfer) 방법을 제안한다. 미세조정 중 냉융합(cold fusion)을 통해 외부 텍스트 데이터를 활용함으로써 성능이 크게 향상되며, 이는 이전의 전이 학습 방법 대비 최대 21.6%의 상대적 향상도를 기록하고, 저자원 데이터(예: 약 50시간)에서 최첨단 하이브리드 시스템과의 성능 격차를 줄인다.

ABSTRACT

This work explores better adaptation methods to low-resource languages using an external language model (LM) under the framework of transfer learning. We first build a language-independent ASR system in a unified sequence-to-sequence (S2S) architecture with a shared vocabulary among all languages. During adaptation, we perform LM fusion transfer, where an external LM is integrated into the decoder network of the attention-based S2S model in the whole adaptation stage, to effectively incorporate linguistic context of the target language. We also investigate various seed models for transfer learning. Experimental evaluations using the IARPA BABEL data set show that LM fusion transfer improves performances on all target five languages compared with simple transfer learning when the external text data is available. Our final system drastically reduces the performance gap from the hybrid systems.

연구 동기 및 목표

  • 제한된 타이핑된 데이터를 가진 새로운 언어에 대한 적응을 향상시켜 저자원 자동 음성 인식(ASR) 문제를 해결한다.
  • 외부 언어 모델(LMs)의 언어적 맥락이 엔드 투 엔드 ASR 시스템에서 전이 학습을 향상시키는지 조사한다.
  • 다국어 S2S 모델의 적응 단계에서 얕은, 깊은, 냉융합 등 다양한 언어 모델 융합 전략의 효과를 탐색한다.
  • 기초 모델의 용량과 다국어 훈련 데이터의 다양성이 저자원 적응 성능에 미치는 영향을 평가한다.
  • 냉융합 전이를 통해 외부 텍스트 데이터를 통합하면 기존 하이브리드 ASR 시스템과 견줄 만하거나 그 이상의 성능을 달성할 수 있음을 입증한다.

제안 방법

  • 다양한 언어 간 공통 어휘를 사용하는 통합 순서-순서(S2S) 아키텍처를 사용해 언어 독립형 엔드 투 엔드 ASR 시스템을 훈련한다.
  • 목표 저자원 언어에 대해 오직 음성 데이터만을 사용하여 사전 훈련된 S2S 모델을 미세조정함으로써 전이 학습을 수행한다(초기 전이 단계).
  • 언어 모델 융합 전이를 도입: 적응 단계 동안 외부 RNNLM을 냉융합(cold fusion) 방식으로 디코더 네트워크에 통합한다. 이때 언어 모델은 전체 적응 훈련 단계 동안 융합된다.
  • 외부 텍스트 데이터(예: IARPA BABEL)를 사용해 RNNLM을 사전 훈련한 후, S2S 디코더와 융합하여 추론 및 훈련 중 언어 모델링 성능을 향상시킨다.
  • 양면 융합, 깊은 융합, 냉융합 등 다양한 융합 전략의 성능을 비교하기 위해, 다양한 양의 음성 데이터를 가진 다섯 가지 저자원 언어에서 평가한다.
  • 모델 용량과 다국어 훈련 데이터 크기(600~2200시간)가 외부 텍스트 데이터와 함께 적응 성능에 미치는 영향을 평가한다.
Fig. 1 : Overview of language model fusion transfer. LM fusion transfer is conducted with monolingual data only.
Fig. 1 : Overview of language model fusion transfer. LM fusion transfer is conducted with monolingual data only.

실험 결과

연구 질문

  • RQ1외부 언어 모델의 언어적 맥락이 저자원 엔드 투 엔드 ASR에서 전이 학습 성능을 향상시키는가?
  • RQ2외부 텍스트 데이터가 존재할 때, 언어 모델 융합 전이와 얕은 융합을 통한 단순 전이 학습 간의 WER 감소율은 어떻게 비교되는가?
  • RQ3언어 모델 융합의 효과는 외부 텍스트 데이터의 가용성과 크기에 따라 달라지는가?
  • RQ4기초 모델의 선택(다양한 양과 종류의 다국어 데이터로 훈련된)이 적응 성능에 미치는 영향은 어떠한가?
  • RQ5외부 텍스트 데이터가 적응 단계에서 이용 가능한 경우, 냉융합 전이가 얕은 융합, 깊은 융합과 비교해 더 뛰어난 성능을 보이는가?

주요 결과

  • 외부 텍스트 데이터가 존재할 경우, 언어 모델 융합 전이(LM fusion transfer)는 단순 전이 학습에 얕은 융합을 사용한 것보다 다섯 가지 저자원 언어(아삼계, 스포카, 라오, 타갈로그, 줄루어)에서 모두 ASR 성능을 크게 향상시킨다.
  • 냉융합 전이(CF-transfer)는 FLP(~50시간) 데이터셋에서 이전의 전이 학습 방법 대비 평균적으로 상대적으로 21.6% WER 감소를 기록했으며, 언어 모델 융합 없이 전이 학습한 경우 대비 최대 6.8% 향상된 성능을 보였다.
  • LLP(~10시간) 데이터셋에서, 더 큰 외부 텍스트 데이터(FLP)를 사용할 경우 CF-transfer는 얕은 융합 대비 평균적으로 10.4% 상대적인 WER 감소를 기록했으며, 이는 적응 과정에서 언어적 맥락의 가치를 입증한다.
  • 제안된 엔드 투 엔드 시스템과 최첨단 BLSTM-HMM 하이브리드 시스템 간의 성능 격차는 외부 텍스트 데이터를 사용할 경우 극적으로 줄어들었으며, 특히 그러한 경우에 두드러졌다.
  • 단지 10시간의 음성 데이터만으로도, 50시간의 텍스트 데이터로 훈련된 RNNLM을 사용할 경우 WER가 뚜렷이 감소했으며, 이는 저자원 환경에서 언어적 맥락이 매우 유익하다는 것을 시사한다.
  • 이 방법은 효율적이고 실용적이다: 외부 언어 모델을 적응 단계 동안만 통합함으로써 계산 비용을 최소화하여, 새로운 언어에 대한 신속한 구현에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.