Skip to main content
QUICK REVIEW

[논문 리뷰] Toward Cross-Domain Speech Recognition with End-to-End Models

Thai‐Son Nguyen, Sebastian Stüker|arXiv (Cornell University)|2020. 03. 09.
Speech Recognition and Synthesis참고 문헌 28인용 수 5
한 줄 요약

이 논문은 순차 기반 기준으로 훈련된 엔드 투 엔드 음성 인식 모델, 특히 순서에서 순서로 및 음성에서 단어로 아키텍처는 기존의 하이브리드 HMM/ANN 모델에 비해 다양한 도메인 간에 훨씬 더 잘 일반화됨을 보여준다. 하이브리드 모델과 달리 혼합 도메인 데이터로 훈련할 경우 성능이 저하되는 것과는 달리, 엔드 투 엔드 모델은 도메인 특화 하이브리드 시스템과 동등한 성능을 달성하며, 입력 도메인이 알려지지 않은 경우에도 도메인 적응형 언어 모델이 필요로 하지 않는다.

ABSTRACT

In the area of multi-domain speech recognition, research in the past focused on hybrid acoustic models to build cross-domain and domain-invariant speech recognition systems. In this paper, we empirically examine the difference in behavior between hybrid acoustic models and neural end-to-end systems when mixing acoustic training data from several domains. For these experiments we composed a multi-domain dataset from public sources, with the different domains in the corpus covering a wide variety of topics and acoustic conditions such as telephone conversations, lectures, read speech and broadcast news. We show that for the hybrid models, supplying additional training data from other domains with mismatched acoustic conditions does not increase the performance on specific domains. However, our end-to-end models optimized with sequence-based criterion generalize better than the hybrid models on diverse domains. In term of word-error-rate performance, our experimental acoustic-to-word and attention-based models trained on multi-domain dataset reach the performance of domain-specific long short-term memory (LSTM) hybrid models, thus resulting in multi-domain speech recognition systems that do not suffer in performance over domain specific ones. Moreover, the use of neural end-to-end models eliminates the need of domain-adapted language models during recognition, which is a great advantage when the input domain is unknown.

연구 동기 및 목표

  • 엔드 투 엔드 모델과 하이브리드 모델 간의 다중 도메인 음성 인식 환경에서의 성능 비교를 조사하는 것.
  • 다양하고 다중 도메인 데이터로 훈련하면 도메인 간 일반화 성능 향상 여부를 평가하는 것.
  • 엔드 투 엔드 모델이 추론 시 도메인 적응형 언어 모델이 필요 없도록 할 수 있는지 확인하는 것.
  • 도메인 식별자에 조건을 주는 것이 외부 도메인 테스트 세트에서의 성능 향상에 기여하는지 탐색하는 것.

제안 방법

  • 전화 대화, 강의, 독서 음성, 뉴스 방송을 포함하는 네 개의 공개 코퍼스인 Switchboard, TED-LIUM, LibriSpeech, Hub4에서 다중 도메인 데이터셋을 구축하였다.
  • 도메인 특화 및 다중 도메인 훈련 세트로 하이브리드 HMM/ANN 모델과 엔드 투 엔드 모델(음성에서 단어로 및 어텐션 기반 순서에서 순서로)을 훈련시켰다.
  • 엔드 투 엔드 모델에 순차 기반 훈련 기준(예: CTC, 교차 엔트로피)을 사용하여 음성 특징에서 단어 시퀀스로의 직접 매핑을 가능하게 하였다.
  • 훈련 및 추론 중에 도메인 ID 토큰으로 출력 시퀀스를 조건화하는 도메인 조건부 엔드 투 엔드 모델을 도입하였다.
  • Hub5’00, TED-LIUM, LibriSpeech, Eval98, MSLT를 포함한 도메인 특화 및 외부 도메인 테스트 세트에서 모델을 평가하였다.
  • 단어 오류율(WER)과 도메인 정확도(DAC)를 사용하여 성능를 측정하였다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 모델을 다중 도메인 데이터로 훈련할 경우, 하이브리드 모델에 비해 다양한 음향적 및 언어적 조건에서 일반화 성능가 향상되는가?
  • RQ2엔드 투 엔드 모델이 도메인 적응형 언어 모델이 필요 없이 도메인 특화 하이브리드 모델과 동등한 성능를 달성할 수 있는가?
  • RQ3도메인 식별자가 효과적으로 학습되어 엔드 투 엔드 모델의 조건화에 사용되어 외부 도메인 입력에서의 성능 향상에 기여할 수 있는가?
  • RQ4왜 엔드 투 엔드 모델은 프레임 기반 하이브리드 모델보다 도메인 간에 더 잘 일반화되는가?

주요 결과

  • 다중 도메인 데이터로 훈련된 엔드 투 엔드 모델은 Hub5’00, TED-LIUM, LibriSpeech, Eval98 테스트 세트에서 모든 도메인 특화 하이브리드 모델을 초월했으며, 각각 18.5, 10.8, 8.4, 11.9의 WER을 기록하였다.
  • 다중 도메인 엔드 투 엔드 모델은 도메인 특화 LSTM 하이브리드 모델과 동등한 성능를 보였으며, 이는 다중 도메인 훈련이 성능 손실를 유발하지 않음을 시사한다.
  • 도메인 조건부 엔드 투 엔드 모델은 Hub5’00에서 99.84%의 도메인 정확도와 Eval98에서 97.93%의 도메인 정확도를 기록하였으며, 표준 엔드 투 엔드 모델과 유사한 WER을 유지하였다.
  • 외부 도메인 MSLT 코퍼스에서 테스트한 결과, Switchboard 도메인에 조건을 주었을 때 도메인 조건부 모델은 23.3%의 WER을 기록하여, 다양한 언어 모델을 사용한 모든 하이브리드 모델을 앞섰다.
  • 문자 기반 순서에서 순서로 모델은 긴 발화(60~120초)에서 성능 저하를 보였지만, 단어 기반 모델은 이 문제를 피했으나 OOV 문제에 직면하였다.
  • 다중 도메인 데이터로 훈련된 하이브리드 모델은 일반화 성능가 떨어졌으며, 도메인 특화 모델보다 성능가 열 劣하였다. 이는 하이브리드 시스템이 다중 도메인 환경에서의 핵심 한계를 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.