Skip to main content
QUICK REVIEW

[논문 리뷰] Streaming Language Identification using Combination of Acoustic Representations and ASR Hypotheses

Chander Chandak, Zeynab Raeesy|arXiv (Cornell University)|2020. 06. 01.
Speech Recognition and Synthesis참고 문헌 5인용 수 9
한 줄 요약

이 논문은 음성 인식(ASR) 1-best 가설에서 유도된 텍스트 임베딩과 음성 임베딩을 결합한 스트리밍 언어 식별(LID) 시스템을 제안한다. 이는 음성 중심 LID 대비 최대 50%의 상대 오차율 감소를 달성하며, 절반 이상의 발화에서 평균 1500ms 빠르게 언어 탐지가 가능하게 하면서도 높은 정확도를 유지한다. 또한 텍스트 기반 LID를 교사 모델로 사용한 준지도 학습을 통해 일반화 능력을 향상시킨다.

ABSTRACT

This paper presents our modeling and architecture approaches for building a highly accurate low-latency language identification system to support multilingual spoken queries for voice assistants. A common approach to solve multilingual speech recognition is to run multiple monolingual ASR systems in parallel and rely on a language identification (LID) component that detects the input language. Conventionally, LID relies on acoustic only information to detect input language. We propose an approach that learns and combines acoustic level representations with embeddings estimated on ASR hypotheses resulting in up to 50% relative reduction of identification error rate, compared to a model that uses acoustic only features. Furthermore, to reduce the processing cost and latency, we exploit a streaming architecture to identify the spoken language early when the system reaches a predetermined confidence level, alleviating the need to run multiple ASR systems until the end of input query. The combined acoustic and text LID, coupled with our proposed streaming runtime architecture, results in an average of 1500ms early identification for more than 50% of utterances, with almost no degradation in accuracy. We also show improved results by adopting a semi-supervised learning (SSL) technique using the newly proposed model architecture as a teacher model.

연구 동기 및 목표

  • 동적 언어 전환을 지원하는 저지연, 고정확도의 다국어 음성 어시스턴트를 위한 언어 식별 시스템을 개발한다.
  • 비음성 중심 LID의 한계를 극복하여 외래어 발음, 언어 혼합, 고도로 유사한 어휘를 가진 언어 쌍을 처리할 수 있도록 한다.
  • 조기 언어 탐지로 인해 비일치하는 ASR 시스템의 조기 종료가 가능해져 계산 비용을 절감한다.
  • 텍스트 기반 LID를 교사 모델로 사용한 준지도 학습을 통해 다국어 음성 패턴에 대한 강인성을 향상시킨다.
  • 지연을 고려하지 않고도 정기적인 간격으로 ASR 가설을 통합할 수 있는 스트리밍 호환 아키텍처를 설계한다.

제안 방법

  • 이중 인코더 아키텍처를 사용한다: 하나는 원시 음성 프레임에서 음성 임베딩을 학습하고, 다른 두 개의 별도 인코더는 1-best ASR 가설을 텍스트 임베딩으로 변환한다.
  • 최종 LID 분류기는 음성 및 텍스트 임베딩을 함께 사용하여 언어 분류를 위한 교차 엔트로피 손실 함수로 공동 학습한다.
  • 스트리밍 런타임 정책은 정기적으로 ASR 가설(예: 600ms 간격)을 LID 모듈에 전달하여 신뢰도 기반 언어 결정을 가능하게 한다.
  • 시스템은 간격 기반 쿼리 정책을 활용하여 정기적인 시간 간격에서 언어 신뢰도를 평가함으로써 비일치하는 ASR 시스템의 조기 종료를 허용한다.
  • 준지도 학습은 사전 학습된 텍스트 기반 LID 모델을 사용해 100만 건의 익명화된 다국어 음성 스트림을 레이블링하고, 이를 통해 음성 중심 LID 모델을 재학습한다.
  • 교사-학생 프레임워크는 레이블 편향을 교정하고 다국어 및 언어 혼합 음성의 표현을 향상시켜 음성 중심 LID 모델의 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1음성 임베딩과 텍스트 기반 임베딩을 조합하면 음성 중심 모델을 초월해 언어 식별 정확도를 향상시킬 수 있는가?
  • RQ2정확도를 희생시키지 않고 스트리밍 환경에서 언어를 얼마나 이르게 식별할 수 있으며, 조기 ASR 종료로 인한 계산적 절감은 어떠한가?
  • RQ3텍스트 기반 LID를 교사 모델로 사용한 준지도 학습이 음성 중심 LID 모델의 다국어 및 언어 혼합 음성에 대한 일반화 능력을 향상시킬 수 있는가?
  • RQ4청각적 신호가 모호한 경우인 영어/힌두어 및 영어/스페인어와 같은 도전적인 언어 쌍에서 시스템의 성능은 어떠한가?
  • RQ5ASR 가설을 LID 파이프라인에 통합할 경우 정확도와 지연 간의 상호 교환 관계는 어떠한가?

주요 결과

  • 음성-텍스트 통합 LID 모델은 음성 중심 LID 대비 오차율을 최대 50% 상대적으로 감소시키며, 영어/스페인어 쌍에서 가장 높은 48.4%의 상대 감소를 기록한다.
  • 발화의 절반 이상에서 언어 식별이 발화 종료 시점보다 평균 1500ms 빨리 이루어져 상당한 계산 비용 절감이 가능하다.
  • 신뢰도 임계값 0.99에서 영어의 경우 비대상 ASR 복원을 43%, 스페인어의 경우 40% 감소시키며 정확도 저하 최소화를 달성한다.
  • 텍스트 기반 LID 레이블을 사용한 준지도 미세조정은 특히 영어/스페인어 및 영어/힌두어와 같은 고빈도 언어 쌍에서 음성 중심 LID 모델의 성능을 향상시킨다.
  • 이 방법은 장기간의 외래어 단어나 외래어 발음으로 인한 음성 중심 모델의 오류, 이중 언어 ASR 출력으로 인한 텍스트 기반 모델의 오류를 효과적으로 완화한다.
  • 기존 음성 중심 LID가 실패하는 언어 혼합 또는 혼합 언어 발화 상황에서도 높은 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.