[논문 리뷰] Multilingual Speech Recognition With A Single End-To-End Model
이 논문은 9개의 인도어에서 문법적 스크립트 겹침이 최소한인 다국어 음성 인식을 위한 단일 엔드 투 엔드 시퀀스-투-시퀀스 모델을 제안한다. 언어별로 명시적인 언어 감독 없이 그래프램 집합의 결합체를 공동으로 훈련시킴으로써, 모델은 단일 언어 기반 기준 대비 21% 상대적 WER 감소를 달성하며, 언어 조건부 인코더 입력을 통해 추가로 7% 향상되어 강력한 다국어 일반화와 암묵적 언어 분리 능력을 입증한다.
Training a conventional automatic speech recognition (ASR) system to support multiple languages is challenging because the sub-word unit, lexicon and word inventories are typically language specific. In contrast, sequence-to-sequence models are well suited for multilingual ASR because they encapsulate an acoustic, pronunciation and language model jointly in a single network. In this work we present a single sequence-to-sequence ASR model trained on 9 different Indian languages, which have very little overlap in their scripts. Specifically, we take a union of language-specific grapheme sets and train a grapheme-based sequence-to-sequence model jointly on data from all languages. We find that this model, which is not explicitly given any information about language identity, improves recognition performance by 21% relative compared to analogous sequence-to-sequence models trained on each language individually. By modifying the model to accept a language identifier as an additional input feature, we further improve performance by an additional 7% relative and eliminate confusion between different languages.
연구 동기 및 목표
- 제한된 데이터와 언어별 구성 요소를 가진 다국어 음성 인식 시스템을 훈련하는 데 도전하는 것.
- 상당한 스크립트 및 발음 차이가 있는 다수의 인도어를 통합적으로 학습할 수 있는 통합된 시퀀스-투-시퀀스 모델이 가능한지 탐색하는 것.
- 언어 정체성 조건부 처리가 모델 성능과 언어 혼동에 미치는 영향을 평가하는 것.
- 모델이 훈련 중 함께 나타나지 않은 언어 간의 코드 스위칭을 수행할 수 있는지 조사하는 것.
제안 방법
- 9개의 인도어에서 유도된 언어별 그래프램 집합의 결합체를 기반으로 단일 어텐션 기반 시퀀스-투-시퀀스 모델을 훈련하는 것.
- 양방향 RNN 인코더와 단방향 RNN 디코더를 갖춘 Listen, Attend and Spell (LAS) 아키텍처를 사용하는 것.
- 인코더를 조건부로 만들기 위해 언어 식별자를 추가 입력 특징으로 도입하는 것.
- 인코더 상태에서 유도된 컨텍스트 벡터를 사용해 청각 특징과 예측 그래프램 시퀀스를 어텐션 메커니즘으로 정렬하는 것.
- 시퀀스 길이를 줄이기 위해 스택된 80차원의 로그-멜 특징과 프레임 스태킹 및 스트라이딩을 적용하는 것.
- 합성 데이터, 언어 불일치 실험, 코드 스위칭 테스트를 통해 모델 행동을 평가하는 것.
실험 결과
연구 질문
- RQ1언어 정체성이 제공되지 않았을 때 통합 다국어 모델이 언어를 얼마나 자주 혼동하는가?
- RQ2훈련 중 함께 나타나지 않은 인도어 간에 모델이 코드 스위칭을 수행할 수 있는가?
- RQ3인코더를 언어 정체성으로 조건부로 설정했을 때 정확도와 언어 충실도에 어떤 영향을 미치는가?
- RQ4통합 모델에서 언어 모델이 청각 모델에 비해 어느 정도 지배적인가?
- RQ5모델이 청각-음소적 내용과 언어 정체성 간에 분리된 표현을 학습하는가?
주요 결과
- 통합 다국어 모델은 각 언어에 대해 별도로 훈련된 단일 언어 모델 대비 상대적으로 21% WER 감소를 달성한다.
- 언어 정체성 조건부 처리를 추가로 적용하면 성능이 추가로 7% 상대적으로 향상되어 언어 혼동이 완전히 제거된다.
- 모델은 혼합 스크립트 출력을 거의 생성하지 않아, 명시적 감독 없이도 강력한 암묵적 언어 식별 능력을 보인다.
- 합성 혼합 언어 발화에서 히타루어와 히누어 간의 코드 스위칭을 수행하지 못해 언어 모델이 청각 모델을 지배하는 것으로 나타났다.
- 우르두어 음성에 히누어 언어 ID를 제공했을 때 모델은 음성을 히누어 스크립트로 변환한다. 이는 음소적 내용과 언어 정체성 간의 분리가 이루어졌음을 시사한다.
- 인코더가 조건부로 설정된 모델은 입력 음성이 언어가 맞지 않더라도 제공된 언어 ID에 매우 충실하게 반응한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.