Skip to main content
QUICK REVIEW

[논문 리뷰] Signal Combination for Language Identification

Shengye Wang, Li Wan|arXiv (Cornell University)|2019. 10. 21.
Speech Recognition and Synthesis참고 문헌 21인용 수 10
한 줄 요약

이 논문은 다국어 음성 인식에서 언어 식별(LangID) 정확도를 햖스키기 위해 다수의 인식기로부터의 음성, 언어 모델, 신뢰도 점수를 융합하는 딥 네ural 네트워크(DNN) 기반 신호 조합 방법을 제안한다. DNN 모델은 기준값(5.5%)에서 오차율을 4.3%로 감소시켜 상대적 감소율 21.8%를 달성하며, 레이티스 기반 앙상블 모델을 능가하고, 특히 누락된 특징이 있는 경우에도 뛰어난 일반화 성능을 보여준다.

ABSTRACT

Google's multilingual speech recognition system combines low-level acoustic signals with language-specific recognizer signals to better predict the language of an utterance. This paper presents our experience with different signal combination methods to improve overall language identification accuracy. We compare the performance of a lattice-based ensemble model and a deep neural network model to combine signals from recognizers with that of a baseline that only uses low-level acoustic signals. Experimental results show that the deep neural network model outperforms the lattice-based ensemble model, and it reduced the error rate from 5.5% in the baseline to 4.3%, which is a 21.8% relative reduction.

연구 동기 및 목표

  • 원시 음성 특징을 초월한 다양한 소스에서 유도된 신호를 융합하여 다국어 음성 인식 시스템에서 언어 식별 정확도를 향상시키는 것.
  • 딥 네ural 네트워크가 전통적인 레이티스 기반 앙상블 방법보다 신호 조합에서 언어 식별에 있어 우월한 성능을 보일 수 있는지 조사하는 것.
  • 누락된 특징이 신호 조합에서 모델의 일반화 능력과 내성에 미치는 영향을 평가하는 것.
  • 음성 모델 비용, 언어 모델 비용, 신뢰도, 엔트로피, 텍스트 기반 LangID를 포함한 인식기 출력을 통합하는 유연하고 학습 가능한 프레임워크를 개발하는 것.
  • 종합된 신호 조합이 종단 간 다국어 음성 인식에서 단어 오차율을 감소시키는 데 효과적인지 입증하는 것.

제안 방법

  • 언어 후보를 쌍으로 묶어 이진 분류 문제로 변환하고, 두 언어 중 어느 쪽이 더 가능성성이 높은지 예측하는 분류기를 학습시킨다.
  • 분류기는 대칭성 제약 조건을 강제한다: f(b,a) = 1 - f(a,b)로, 모든 언어 쌍에 대해 일관된 순위를 보장한다.
  • 입력 특징으로는 음성 기반 LangID 점수, 음성 모델 비용, 언어 모델 비용, 신뢰도 점수, N-best 후보의 엔트로피, 텍스트 기반 LangID 점수를 포함한다.
  • ReLU 활성화 함수, 배치 정규화, 50% 드롭아웃, He 가중치 초기화를 사용한 나블라형 아키텍처(12-128-64-32-16-8)를 가진 딥 네ural 네트워크를 분류에 사용한다.
  • 학습 안정성을 높이기 위해 특징을 최소-최대 스케일링 또는 로그 변환을 통해 [-1,1] 범위로 정규화한다.
  • 학습에는 Adam 옵티마이저를 사용하며, 학습률 감소, 50M 스텝에서의 조기 정지, 그리고 11개의 학습된 모델을 평균화하여 정확도를 향상시킨다.

실험 결과

연구 질문

  • RQ1딥 네ural 네트워크가 언어 식별을 위한 다수의 인식기 신호 조합에서 레이티스 기반 앙상블 모델을 능가할 수 있는가?
  • RQ2예를 들어 언어 모델 점수가 누락된 경우와 같은 인식기 특징의 유무가 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
  • RQ3특징 마스킹을 통한 데이터 증강이 모델의 내성과 미리 보지 않은 데이터에 대한 정확도를 향상시키는가?
  • RQ4신호 조합이 종단 간 다국어 음성 인식에서 단어 오차율에 어떤 영향을 미치는가?
  • RQ5통합적이고 학습 가능한 모델이 음성, 언어 모델, 신뢰도, 엔트로피, 텍스트 기반 LangID 등의 다양한 인식기 출력을 효과적으로 통합하여 LangID 정확도를 향상시킬 수 있는가?

주요 결과

  • DNN 기반의 신호 조합 모델은 언어 식별 오차율을 기준값(5.5%)에서 4.3%로 감소시켜 상대적 감소율 21.8%를 달성한다.
  • DNN 모델은 레이티스 기반 앙상블 모델보다 우수하며, 이 모델은 오차율을 5.5%에서 4.5%로 감소시켜 상대적 감소율 23.7%를 기록한다.
  • 'both' 데이터 서브셋(모든 인식기 특징 존재)에서 DNN는 2.0% 오차율을 기록했고, 레이티스 모델은 2.4%였다.
  • 'either' 데이터 서브셋(부분적 특징)에서 두 모델 모두 4.0% 오차율을 기록하여, 누락된 특징에 대한 내성 능력이 뛰어나다는 것을 보여준다.
  • 종단 간 다국어 음성 인식에서 DNN 모델은 단어 오차율을 기준값(13.6%)에서 12.8%로 감소시켜 0.8%포인트의 향상을 달성한다.
  • 특징 마스킹을 통한 증강 데이터로 학습하면 일반화 능력이 향상되어, 증강 없이 학습한 경우보다 'both' 데이터에서 더 높은 정확도를 기록한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.