Skip to main content
QUICK REVIEW

[논문 리뷰] Multilingual Speech Recognition using Knowledge Transfer across Learning Processes

Rimita Lahiri, Kenichi Kumatani|arXiv (Cornell University)|2021. 10. 15.
Speech Recognition and Synthesis참고 문헌 25인용 수 4
한 줄 요약

이 논문은 언어 ID 원핫 벡터와 메타학습 접근법(LEAP)을 융합하여 학습 과정 간 지식 전이를 통해 성능을 향상시키는 다국어 음성 인식 프레임워크를 제안한다. 이와 더불어 자기지도 학습(self-supervised learning, SSL)을 활용한다. 이 방법은 언어별 작업 다양체(manifold)를 따라 이동하는 기대 경로 길이를 최소화하여, 전체적으로 3.55%의 상대적 WER 감소와 언어 ID를 포함한 경우 3.51%의 감소를 달성하며, 기준 SSL 및 LEAP만을 사용한 경우보다 뛰어난 성능을 보인다.

ABSTRACT

Multilingual end-to-end(E2E) models have shown a great potential in the expansion of the language coverage in the realm of automatic speech recognition(ASR). In this paper, we aim to enhance the multilingual ASR performance in two ways, 1)studying the impact of feeding a one-hot vector identifying the language, 2)formulating the task with a meta-learning objective combined with self-supervised learning (SSL). We associate every language with a distinct task manifold and attempt to improve the performance by transferring knowledge across learning processes itself as compared to transferring through final model parameters. We employ this strategy on a dataset comprising of 6 languages for an in-domain ASR task, by minimizing an objective related to expected gradient path length. Experimental results reveal the best pre-training strategy resulting in 3.55% relative reduction in overall WER. A combination of LEAP and SSL yields 3.51% relative reduction in overall WER when using language ID.

연구 동기 및 목표

  • 저자원 및 불균형 언어 설정에서 다국어 자동 음성 인식(ASR) 성능을 향상시키는 것.
  • 언어 ID를 원핫 벡터로 조건화하는 것이 다국어 ASR 정확도를 향상시키는지 조사하는 것.
  • 특히 LEAP 프레임워크를 사용해 기대 경로 길이를 최소화함으로써 학습 과정 간 지식 전이를 탐색하는 것.
  • 자기지도 학습(SSL)과 메타학습을 융합하여 개선된 다국어 표현 학습을 위한 방법을 제시하는 것.
  • 언어 ID, LEAP, SSL의 병합 효과가 여러 언어 간 단어 오류율(WER)에 미치는 영향을 평가하는 것.

제안 방법

  • 모델은 트랜스포머 인코더와 LSTM 디코더를 갖춘 트랜스포머 트랜듀서 아키텍처를 사용하며, 엔드 투 엔드로 훈련된다.
  • 언어 ID는 각 언어별 학습을 이끄는 데 도움을 주기 위해 원핫 벡터 입력으로 삽입되어, 저자원 언어의 표현을 향상시킨다.
  • LEAP 메타학습 프레임워크는 언어별 작업에 따라 훈련 중 이동하는 경로 길이의 기대값을 최소화함으로써 초기화를 최적화하는 데 적용된다.
  • 자기지도 학습(SSL) 사전훈련은 레이블이 없는 대규모 다국어 데이터에서 수행되며, 이후 레이블된 데이터로 미세조정된다.
  • 훈련 파이프라인은 반복적 자기훈련과 사전훈련을 결합하며, 미세조정에는 AdamW를, LEAP-SSL의 메타최적화기로는 Adam을 사용한다.
  • 목적 함수는 SSL 대비 손실과 경로 길이 정규화 항을 조합하여 언어 작업 간 효율적인 학습을 촉진한다.

실험 결과

연구 질문

  • RQ1언어 ID를 원핫 벡터로 삽입하면 저자원 언어에 특히 유리한 다국어 ASR 성능 향상이 이루어지는가?
  • RQ2메타학습(LEAP)을 통한 학습 과정 간 지식 전이로 기대 경로 길이를 줄이고 다국어 ASR 정확도를 향상시킬 수 있는가?
  • RQ3LEAP와 자기지도 학습(SSL)을 융합하면 여러 언어 간 WER에 어떤 영향을 미치는가?
  • RQ4LEAP-SSL의 성능 향상 효과가 언어 ID 정보의 유무에 따라 달라지는가?
  • RQ5SSL 사전훈련과 미세조정에 동일한 데이터를 사용할 경우 다국어 표현 학습에 어떤 영향을 미치는가?

주요 결과

  • LEAP와 SSL에 언어 ID 입력을 융합한 결과, 전체적으로 3.51%의 상대적 WER 감소를 달성한다.
  • 언어 ID를 원핫 벡터로 사용할 경우 러시아어(RU)에 대해 21.06%의 상대적 WER 감소와 프랑스어(FR-FR)에 대해 20.69%의 감소를 기록하여 특정 언어에서 뚜렷한 성능 향상을 보인다.
  • 언어 ID 없이도 LEAP-SSL은 대부분의 지역에서 성능 저하를 보이며, 효과적인 메타학습 초기화를 위해서는 언어 정보가 필수적임을 시사한다.
  • SSL만으로도 모든 언어에서 WER를 향상시키며, 특히 언어 ID를 사용하지 않을 경우 일반적인 다국어 표현 학습에 효과적임을 입증한다.
  • 언어 ID를 포함한 LEAP-SSL 방법은 브라질 포르투갈어(PT-BR)를 제외한 모든 언어에서 일관된 WER 향상을 달성한다. PT-BR에서는 성능 향상이 미미하다.
  • 전반적으로 가장 우수한 사전훈련 전략은 3.55%의 상대적 WER 감소를 이끌어내며, 제안된 지식 전이 메커니즘이 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.