Skip to main content
QUICK REVIEW

[논문 리뷰] Dual Language Models for Code Mixed Speech Recognition

Saurabh Garg, Tanmay Parekh|arXiv (Cornell University)|2017. 11. 03.
Speech Recognition and Synthesis참고 문헌 18인용 수 9
한 줄 요약

이 논문은 중국어-영어 대화 코퍼스에서 외부 데이터 없이도 표준 双어 언어모델보다 퍼플렉서티와 음성인식 오류율을 크게 향상시키는, 비확률적 전환 메커니즘을 통해 두 개의 단어어 언어모델(중국어 및 영어)을 결합한 이중 언어모델을 제안한다.

ABSTRACT

In this work, we present a simple and elegant approach to language modeling for bilingual code-switched text. Since code-switching is a blend of two or more different languages, a standard bilingual language model can be improved upon by using structures of the monolingual language models. We propose a novel technique called dual language models, which involves building two complementary monolingual language models and combining them using a probabilistic model for switching between the two. We evaluate the efficacy of our approach using a conversational Mandarin-English speech corpus. We prove the robustness of our model by showing significant improvements in perplexity measures over the standard bilingual language model without the use of any external information. Similar consistent improvements are also reflected in automatic speech recognition error rates.

연구 동기 및 목표

  • 자연스러운 대화에서 언어가 혼합되는 이중 언어 코드스위칭 음성 인식 모델링의 과제를 해결하기 위해.
  • 표준 이중 언어 언어모델을 초월하여 코드스위칭 텍스트를 위한 언어모델링을 향상시키기 위해.
  • 외부 언어학적 자원이 필요 없이 단어어 언어모델 구조를 활용하는 방법을 개발하기 위해.
  • 실제 대화형 중국어-영어 음성 코퍼스에서 접근법을 평가하기 위해.
  • 퍼플렉서티와 자동 음성인식 성능 양 측면에서 일관된 향상을 입증하기 위해.

제안 방법

  • 각 언어(예: 중국어 및 영어)별로 별도의 단어어 언어모델을 구축하고, 단어어 데이터를 기반으로 훈련한다.
  • 각 토큰에서 두 언어 사이로 전환될 가능성을 모델링하는 확률적 전환 메커니즘을 도입한다.
  • 전환 확률에 기반하여 두 단어어 모델의 출력을 가중 혼합하여 결합한다.
  • 코드스위칭 텍스트 데이터를 사용하여 퍼플렉서티 최적화를 위해 종단간(end-to-end)으로 이중 언어모델을 훈련한다.
  • 결합된 모델을 자동 음성인식 시스템 내 언어모델로 사용한다.
  • 성능 평가를 위해 모델을 대화형 중국어-영어 음성 코퍼스에 적용한다.

실험 결과

연구 질문

  • RQ1확률적 전환 메커니즘을 통해 두 개의 단어어 언어모델을 결합하면 코드스위칭 언어모델링이 향상되는가?
  • RQ2표준 이중 언어 언어모델보다 이중 언어모델 접근법이 퍼플렉서티 감소에 더 효과적인가?
  • RQ3이중 언어모델은 코드스위칭 음성에서 자동 음성인식 오류율을 어느 정도 향상시키는가?
  • RQ4외부 언어학적 정보나 애너테이션에 의존하지 않고도 모델이 더 나은 성능을 낼 수 있는가?
  • RQ5이중 언어모델은 대화 음성에서 다양한 코드스위칭 패턴에 대해 얼마나 견고한가?

주요 결과

  • 이중 언어모델은 중국어-영어 코드스위칭 코퍼스에서 표준 이중 언어 언어모델보다 퍼플렉서티를 크게 감소시킨다.
  • 외부 언어학적 정보를 사용하지 않고도 자동 음성인식 오류율에서 일관된 향상을 달성한다.
  • 대화 음성에서 다양한 코드스위칭 패턴에 걸쳐 성능 향상이 견고하게 유지된다.
  • 확률적 전환 메커니즘이 자연스러운 코드스위칭 텍스트에서 언어 전환을 효과적으로 포착한다.
  • 강력한 단어어 사전 지식 덕분에 자원이 제한된 환경에서도 표준 이중 언어 모델을 능가한다.
  • 결과적으로 단어어 모델 구조를 활용하는 것이 단순한 이중 언어 혼합을 초월해 코드스위칭 언어모델링을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.