Skip to main content
QUICK REVIEW

[논문 리뷰] Large-Scale Multilingual Speech Recognition with a Streaming End-to-End Model

Anjuli Kannan, Arindrima Datta|arXiv (Cornell University)|2019. 09. 11.
Speech Recognition and Synthesis참고 문헌 32인용 수 4
한 줄 요약

이 논문은 RNN-T를 사용한 스트리밍 엔드 투 엔드(E2E) 다국어 음성 인식 모델을 제안하며, 9개 인도 언어에서 단일 언어 E2E 및 전통적인 ASR 시스템을 모두 능가한다. 언어 벡터와 언어별 어댑터 모듈을 조합함으로써 일관된 10% 상대적 WER 감소를 달성하였으며, 자원이 적은 언어에서는 최대 34%까지 향상되었고, 실시간 응용 프로그램에 적합한 낮은 지연 시간을 유지한다.

ABSTRACT

Multilingual end-to-end (E2E) models have shown great promise in expansion of automatic speech recognition (ASR) coverage of the world's languages. They have shown improvement over monolingual systems, and have simplified training and serving by eliminating language-specific acoustic, pronunciation, and language models. This work presents an E2E multilingual system which is equipped to operate in low-latency interactive applications, as well as handle a key challenge of real world data: the imbalance in training data across languages. Using nine Indic languages, we compare a variety of techniques, and find that a combination of conditioning on a language vector and training language-specific adapter layers produces the best model. The resulting E2E multilingual model achieves a lower word error rate (WER) than both monolingual E2E models (eight of nine languages) and monolingual conventional systems (all nine languages).

연구 동기 및 목표

  • 스피치 어시스턴트와 같은 상호작용형 응용 프로그램에 적합한 스트리밍, 저지연 다국어 ASR 시스템을 개발하는 것.
  • 자원이 많은 언어가 데이터 분포의 비대칭성으로 인해 지배하는 다국어 학습에서의 데이터 불균형 문제를 해결하는 것.
  • 자원이 적은 언어의 성능을 향상시키되, 자원이 많은 언어의 정확도를 희생시키지 않는 것.
  • 단일 E2E 모델이 다수의 단일 언어 모델보다 우수한 성능을 보이며, 배포를 단순화할 수 있음을 입증하는 것.

제안 방법

  • 스트리밍 추론을 위해 RNN-T 아키텍처를 사용하여 과거 출력과 현재 음성 프레임에 조건을 붙임으로써 실시간 지연을 가능하게 한다.
  • 목표 언어에 조건을 붙이기 위해 언어 벡터를 활용하여 다양한 언어 간의 모호함을 해소한다.
  • 언어별 어댑터 모듈—에코더 레이어에 삽입되는 소형 학습 가능한 피드포워드 네트워크—를 적용하여 언어별로 효율적인 특화를 가능하게 한다.
  • 클래스 균형 샘플링과 적응형 가중치 조정을 사용하여 데이터 불균형을 완화하지만, 언어 벡터와 함께 사용될 경우 효과가 떨어진다.
  • 언어 벡터와 어댑터를 조합하여 모든 언어, 특히 자원이 적은 언어에서의 강건성과 성능을 동시에 향상시킨다.
  • 9개 인도 언어의 37,000시간 분량의 다국어 코퍼스를 기반으로 단일 언어 E2E 및 전통적인 ASR 기준 모델과 비교 평가한다.

실험 결과

연구 질문

  • RQ1스트리밍 엔드 투 엔드 다국어 ASR 모델이 저지연을 유지하면서 최신 단일 언어 전통적 시스템 수준의 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ2데이터 불균형이 있는 다국어 학습에서 언어 벡터와 어댑터 모듈이 자원이 적은 언어의 성능 저하를 얼마나 효과적으로 완화하는가?
  • RQ3언어 벡터와 언어별 어댑터 모듈을 결합하면 단독 기술이나 데이터 샘플링 전략보다 더 나은 성능을 내는가?
  • RQ4데이터 불균형이 모델 성능에 미치는 영향은 어느 정도이며, 어댑터와 같은 아키텍처 수정이 비대칭적인 데이터 분포를 보완할 수 있는가?
  • RQ5단일 E2E 모델이 정확도와 배포 효율성 측면에서 9개의 별도 단일 언어 모델을 대체할 수 있는가?

주요 결과

  • 제안된 다국어 E2E 모델은 9개 언어 중 8개 언어에서 단일 언어 E2E 모델보다 낮은 단어 오류율(WER)을 달성한다.
  • 모델은 모든 9개 언어에서 단일 언어 전통적 ASR 시스템을 능가하며, 일관된 10% 상대적 WER 감소를 기록했고, 칸나다와 같은 자원이 적은 언어에서는 최대 34% 상대적 향상을 보였다.
  • 언어 벡터와 어댑터 모듈의 조합이 가장 우수한 성능을 보였으며, 칸나다에서는 9% 상대적 WER 감소, 우르두어에서는 8%를 기록했다.
  • 언어 벡터 조건화만으로도 자원이 적은 언어의 WER를 감소시켰지만, 자원이 많은 언어에서는 성능 저하가 발생했다. 어댑터는 과적합을 방지하면서도 언어별 적응을 가능하게 하여 이 문제를 완화한다.
  • 어댑터는 언어당 약 250만 개의 파라미터만 추가하며(전체 모델의 약 2%), 매우 높은 파라미터 효율성을 보이며 선택적 배포가 가능하다.
  • RNN-T를 통해 스트리밍 기능을 유지하여 실시간 추론이 가능하며, 스피치 어시스턴트와 같은 상호작용형 응용 프로그램에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.