Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Language Transfer Learning, Continuous Learning, and Domain Adaptation for End-to-End Automatic Speech Recognition

Jocelyn Huang, Oleksii Kuchaiev|arXiv (Cornell University)|2020. 05. 08.
Speech Recognition and Synthesis참고 문헌 21인용 수 20
한 줄 요약

이 논문은 대규모 사전 훈련된 영어 QuartzNet ASR 모델을 미세조정함으로써 다양한 ASR 작업에서 성능이 크게 향상됨을 보여준다. 이는 다국어 전이(독일어, 스페인어, 러시아어), 도메인 적응(재무 실적 전화 통화), 발음 변형 등에 적용된다. 이 방법은 작은 타겟 데이터셋이 있더라도 훈련을 처음부터 시작하는 것보다 항상 우수한 성능을 보이며, 대규모 데이터 설정에서는 수렴 속도가 최대 18배 빨라진다. 사전 훈련된 모델은 일반화 능력을 향상시키는 강력한 정규화 요소로 작용한다.

ABSTRACT

In this paper, we demonstrate the efficacy of transfer learning and continuous learning for various automatic speech recognition (ASR) tasks. We start with a pre-trained English ASR model and show that transfer learning can be effectively and easily performed on: (1) different English accents, (2) different languages (German, Spanish and Russian) and (3) application-specific domains. Our experiments demonstrate that in all three cases, transfer learning from a good base model has higher accuracy than a model trained from scratch. It is preferred to fine-tune large models than small pre-trained models, even if the dataset for fine-tuning is small. Moreover, transfer learning significantly speeds up convergence for both very small and very large target datasets.

연구 동기 및 목표

  • 사전 훈련된 영어 ASR 모델에서의 전이 학습이 자원이 적은 언어, 발음, 도메인 특화 음성에서 성능 향상에 기여하는지 조사하기.
  • 작은 또는 큰 타겟 데이터셋에서 사전 훈련된 대규모 모델을 미세조정하는 것과 처음부터 훈련하는 것의 효과를 평가하기.
  • 지속적 학습에서 치명적인 잊음(catastrophic forgetting)의 발생 여부와 미세조정 시 사전 훈련 데이터를 유지할 필요성 검토하기.
  • 모델 크기와 학습률 스케줄링이 전이 학습 성능에 미치는 영향 평가하기.

제안 방법

  • 사전 훈련 시 사용된 것보다 10배 작은 초기 학습률을 사용하여 타겟 데이터셋에서 사전 훈련된 QuartzNet 인코더(15x5)를 미세조정한다.
  • 알파벳이 다른 비영어 언어의 경우, 새로운 얕은 디코더를 초기화하고, 그렇지 않은 경우 사전 훈련된 디코더를 로드한다.
  • 모든 실험에 대해 NeMo 툴킷을 사용하며, 작업 간 동일한 초모수를 유지한다.
  • 치명적인 잊음을 방지하기 위해 미세조정 시 원본 사전 훈련 데이터의 일부를 포함시킨다.
  • 다국어, 다발음, 도메인 적응 작업 전반에 동일한 전이 학습 레시피를 적용한다.
  • 대규모 재무 데이터(50,000시간 이상)에서 훈련하여, 사전 훈련된 모델과 처음부터 훈련한 모델 간의 수렴 속도와 최종 정확도를 비교한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 영어 ASR 모델을 미세조정하는 것이 자원이 적은 언어에서 처음부터 훈련하는 것보다 더 우수한 성능을 내는가?
  • RQ2작은 타겟 데이터셋에서 미세조정할 때 모델 크기가 전이 학습 성능에 미치는 영향은 무엇인가?
  • RQ3대규모 데이터 ASR 훈련에서 전이 학습이 수렴 속도를 크게 가속화할 수 있는가?
  • RQ4사전 훈련 데이터를 유지하지 않고 미세조정할 경우 치명적인 잊음이 어느 정도 발생하는가?
  • RQ5동일한 전이 학습 레시피가 다국어, 다발음, 도메인 특화 등 다양한 유형의 ASR 적응에 일반화되는가?

주요 결과

  • 사전 훈련된 15x5 QuartzNet 모델을 미세조정한 결과, 독일어 Common Voice에서 WER 23.35%를 기록했으며, 처음부터 훈련한 모델(30.42%)과 더 작은 5x3 모델(28.61%)보다 뛰어난 성능을 보였다.
  • 러시아어의 경우, 사전 훈련된 모델을 사용해 WER를 처음부터 훈련한 경우 59.50%에서 5D 모델을 사용해 32.20%로 감소시켜, 작은 데이터에서 강력한 정규화 효과를 입증했다.
  • 재무 도메인에서는 사전 훈련된 모델이 처음부터 훈련한 모델보다 최종 정확도의 90%에 도달하는 데 18배 더 빠른 속도를 보였다.
  • 항상 대규모 사전 훈련된 모델을 미세조정할 때 최고의 성능가를 기록했으며, 이는 타겟 데이터셋이 사전 훈련 데이터보다 10배 이상 클 경우에도 동일하게 성립했다.
  • 사전 훈련 데이터를 제외하고 미세조정할 경우 치명적인 잊음이 발생했으며, 이는 지속적 학습에서 이를 유지할 필요성을 확인했다.
  • 모든 시험된 상황—다국어, 다발음, 도메인 적응—에서 이 방법은 처음부터 훈련하는 것보다 일관되게 향상된 성능을 보였으며 효과적이었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.