Skip to main content
QUICK REVIEW

[논문 리뷰] Cantonese Automatic Speech Recognition Using Transfer Learning from Mandarin

Bryan Li, Xinyue Wang|arXiv (Cornell University)|2019. 11. 21.
Speech Recognition and Synthesis참고 문헌 9인용 수 5
한 줄 요약

이 논문은 사전에 훈련된 간체중국어 가중치로 TDNN 모델을 초기화하여 저자원 간이어스피치인식기(ASR)를 구축하기 위한 전이학습 방법을 제안한다. 제한된 간이어 데이터셋에서 전이된 모델을 미세조정함으로써 더 빠른 수렴과 약간의 문자오류률(CER) 향상을 달성하였으며, BABEL 간이어 데이터셋에서 새로운 최고 성능 기록인 34.6%를 기록하였다.

ABSTRACT

We propose a system to develop a basic automatic speech recognizer(ASR) for Cantonese, a low-resource language, through transfer learning of Mandarin, a high-resource language. We take a time-delayed neural network trained on Mandarin, and perform weight transfer of several layers to a newly initialized model for Cantonese. We experiment with the number of layers transferred, their learning rates, and pretraining i-vectors. Key findings are that this approach allows for quicker training time with less data. We find that for every epoch, log-probability is smaller for transfer learning models compared to a Cantonese-only model. The transfer learning models show slight improvement in CER.

연구 동기 및 목표

  • 저자원 언어인 간이어와 같은 언어에 대해 효과적인 자동음성인식(ASR) 시스템을 개발하는 데 도전한다.
  • 저자원 간이어 데이터에 비해 풍부한 고품질 간체중국어 ASR 자원을 활용하여 간이어 ASR 성능을 향상시킨다.
  • 시간지연신경망(TDNN)을 사용하여 간체중국어에서 간이어로의 전이학습의 효과성을 조사한다.
  • 전이된 층 수, 학습률, 사전훈련된 i-벡터와 같은 초모수를 최적화하여 모델 성능을 향상시킨다.
  • 정보 기반의 모델 초기화와 미세조정을 통해 BABEL 간이어 데이터셋에서 새로운 최고 성능의 CER 기록을 달성한다.

제안 방법

  • AISHELL2 데이터셋의 1000시간 분량의 깨끗한 간체중국어 음성 데이터로 TDNN 모델을 훈련한다.
  • 사전에 훈련된 간체중국어 모델의 첫 k개 층에서 학습된 가중치를 간이어용으로 새로 초기화된 TDNN에 전이한다.
  • IARPA Babel 간이어 데이터셋의 215시간 분량의 대화형 간이어 음성 데이터로 전이된 모델을 미세조정한다.
  • 성능 최적화를 위해 k(전이된 층 수)와 학습률(lr = 0, 0.25, 1.0)의 다양한 값을 실험한다.
  • 전이학습된 모델과 간이어 데이터에서 처음부터 훈련된 기준 모델 간의 훈련 동역학과 손실 곡선을 비교한다.
  • 문자오류률(CER)과 단어오류률(WER)을 사용하여 모델 성능을 평가하며, CER를 주요 지표로 삼는다.

실험 결과

연구 질문

  • RQ1간체중국어와 같은 고자원 언어에서의 전이학습이 간이어와 같은 저자원 언어의 ASR 성능을 향상시킬 수 있는가?
  • RQ2전이된 층 수(k)가 최종 CER와 훈련 동역학에 어떤 영향을 미치는가?
  • RQ3간이어 데이터에 대해 전이된 모델을 미세조정할 때 최적의 학습률은 무엇인가?
  • RQ4간체중국어에서 사전에 훈련한 i-벡터를 간이어로 전이하면 인식 성능이 향상되는가?
  • RQ5전이학습은 정확도를 유지하거나 향상시키면서도 훈련 시간을 줄일 수 있는가?

주요 결과

  • 사전에 훈련된 간체중국어 TDNN에서 온 가중치 초기화를 통해 훈련 반복당 시간이 크게 단축되었으며, 특히 초기 층이 고정된 경우 두드러진다.
  • 전이학습된 모델은 기준 모델보다 항상 낮은 로그확률(교차엔트로피 손실)을 기록하여 더 빠른 수렴을 나타낸다.
  • 가장 뛰어난 성능을 보인 모델은 k=4개의 전이된 층과 학습률 1.0을 사용하여 CER 34.6%를 달성하였으며, 기준 모델 대비 약간의 향상이다.
  • 전이된 층에 대해 학습률이 0(lr=0)인 모델은 성능이 열 劣하므로, 언어 간 차이가 있음에도 불구하고 일부 미세조정이 필요하다는 것을 시사한다.
  • 간체중국어에서 사전에 훈련한 i-벡터를 간이어로 전이하는 것은 성능 향상에 기여하지 않았으며, 실험 결과 바람직하지 않다고 판단된다.
  • 결과는 TDNN의 초기 층이 더 일반적이고 언어에 종속되지 않는 특징을 학습하므로 전이에 적합하며, 후속 층은 언어 특화 적응을 통해 더 유익하다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.