Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Language-Universal End-to-End Speech Recognition

Suyoun Kim, Michael L. Seltzer|arXiv (Cornell University)|2017. 11. 06.
Speech Recognition and Synthesis참고 문헌 17인용 수 6
한 줄 요약

이 논문은 언어별 출력 레이어 없이 다국어를 동시에 인식할 수 있도록 공통의 유니버설 문자셋과 언어별 게이팅 메커니즘을 사용하는 언어 유니버설 엔드 투 엔드 음성 인식 시스템을 제안한다. 모델은 단일 언어 및 다중 작업 학습 베이스라인을 능가하며, 자원이 적은 언어에 대해 강력한 제로샷 초기화 성능을 보이고, 성능 저하가 최소한인 코드 스위칭 기능을 갖춘 双어 모델을 구현할 수 있다.

ABSTRACT

Building speech recognizers in multiple languages typically involves replicating a monolingual training recipe for each language, or utilizing a multi-task learning approach where models for different languages have separate output labels but share some internal parameters. In this work, we exploit recent progress in end-to-end speech recognition to create a single multilingual speech recognition system capable of recognizing any of the languages seen in training. To do so, we propose the use of a universal character set that is shared among all languages. We also create a language-specific gating mechanism within the network that can modulate the network's internal representations in a language-specific way. We evaluate our proposed approach on the Microsoft Cortana task across three languages and show that our system outperforms both the individual monolingual systems and systems built with a multi-task learning approach. We also show that this model can be used to initialize a monolingual speech recognizer, and can be used to create a bilingual model for use in code-switching scenarios.

연구 동기 및 목표

  • 다국어 음성 인식에서의 확장성과 데이터 부족 문제를 해결하기 위해, 다수의 언어를 지원하는 단일 모델을 구축하는 것.
  • 언어별 발음 사전이 필요 없도록 엔드 투 엔드 그래피엠 기반 인식을 위해 유니버설 문자셋을 사용하는 것.
  • 언어에 따라 다른 방식으로 내부 표현을 조절하는 언어별 게이팅 유닛을 도입하여 다국어 모델링을 향상시키는 것.
  • 실제 다국어 데이터에서 모델의 성능을 평가하고, 자원이 제한된 단일 언어 시스템의 초기화 방법으로서의 유용성을 검토하는 것.
  • 단일 모델이 문자셋의 합집합만으로도 두 언어 간의 코드 스위칭을 처리할 수 있는지의 가능성을 탐색하는 것.

제안 방법

  • 모델은 모든 언어에서 공통으로 사용하는 유니버설 문자셋을 사용하는 Connectionist Temporal Classification (CTC)를 사용하며, 언어별 출력 레이어를 대체한다.
  • 언어별 게이팅 메커니즘이 도입되며, 언어 정체성이 각 네트워크 레이어에서 곱셈 상호작용을 통해 은닉 표현을 조절한다.
  • 게이팅 유닛은 언어 정체성과 현재 은닉 상태를 사용하여 게이트 벡터를 계산하고, 이를 은닉 표현에 원소별로 적용한다.
  • 모델는 음성 특징과 레이블 시퀀스 간의 가능한 모든 정렬에 대해 최대우도 기준으로 엔드 투 엔드로 훈련된다.
  • 언어 정체성이 원-핫 벡터로 인코딩되어 게이팅 메커니즘의 입력으로 사용되며, 언어에 따라 동적으로 적응할 수 있도록 한다.
  • 모델는 Microsoft Cortana 작업에서 영어, 독일어, 스페인어 3개 언어를 대상으로 WER 및 CER를 평가 지표로 사용하여 평가된다.

실험 결과

연구 질문

  • RQ1언어별 출력 레이어 없이도 단일 엔드 투 엔드 ASR 모델이 다국어에서 경쟁적인 성능을 달성할 수 있는가?
  • RQ2유니버설 문자셋과 언어별 게이팅을 조합할 경우, 기존의 다중 작업 학습보다 다국어 인식 성능이 향상되는가?
  • RQ3다국어 모델이 자원이 제한된 단일 언어 모델을 훈련시키는 데 효과적인 초기화 방법으로 기능할 수 있는가?
  • RQ4문자셋의 합집합만으로도 두 언어 간의 코드 스위칭을 처리할 수 있는 단일 모델을 훈련시키는 것이 가능한가?
  • RQ5게이팅을 통한 언어 정체성 포함 방식이 단순한 입력 수준의 언어 임베딩과 비교해 인식 정확도에서 어떻게 다른가?

주요 결과

  • 제안된 언어 유니버설 모델은 언어 모델을 사용하지 않더라도 영어, 독일어, 스페인어에 대해 각각 7.0%, 8.6%, 11.1%의 상대적 WER 향상을 달성했다.
  • 언어별 게이팅 메커니즘이 모든 언어 지향적 접근 방식 중에서 가장 큰 성능 향상을 보였으며, 단순 언어 임베딩이나 은닉 상태 기반 게이팅을 사용하는 모델보다 뛰어났다.
  • 150시간의 독일어 데이터로 미세조정한 결과, 게이팅이 적용된 영어, 독일어, 스페인어로 사전 훈련된 모델는 CER 19.4%를 기록했으며, 더 큰 단일 언어 영어 데이터로 사전 훈련된 모델보다 우수한 성능을 보였다.
  • 영어 150시간과 스페인어 150시간의 데이터로 훈련된 이중 언어 모델은 영어 및 스페인어 테스트 세트에서 각각 WER 38.8%와 45.1%를 기록했으며, 단일 언어 모델과 유사한 성능을 보였다.
  • 독일어 데이터로의 미세조정 없이도 CER 20.6%를 기록하여, 다국어 사전 훈련을 통한 강력한 제로샷 일반화 능력을 입증했다.
  • 모든 레이어에 게이팅을 적용했을 때 최고의 성능를 기록하여, 언어별 조절이 네트워크 전반에 걸쳐 적용될 때 가장 효과적임을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.