Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-Dialect Speech Recognition With A Single Sequence-To-Sequence Model

Bo Li, Tara N. Sainath|arXiv (Cornell University)|2017. 12. 05.
Speech Recognition and Synthesis참고 문헌 21인용 수 10
한 줄 요약

이 논문은 인코더 및 디코더 레이어에 1-핫 다이얼ект 벡터를 통합하고, 번역 결과에 다이얼렉트 레이블을 첨부하여 다중 다이얼렉트 영어 음성 인식을 위한 단일 시퀀스-투-시퀀스(LAS) 모델을 제안한다. 이 방법은 그래프램 예측과 다이얼렉트 분류를 공동으로 학습하게 하여, 일곱 개인 영어 다이얼렉트에서 3.1–16.5%의 상대적 WER 감소를 달성하며, 개별적으로 훈련된 모델들을 능가한다.

ABSTRACT

Sequence-to-sequence models provide a simple and elegant solution for building speech recognition systems by folding separate components of a typical system, namely acoustic (AM), pronunciation (PM) and language (LM) models into a single neural network. In this work, we look at one such sequence-to-sequence model, namely listen, attend and spell (LAS), and explore the possibility of training a single model to serve different English dialects, which simplifies the process of training multi-dialect systems without the need for separate AM, PM and LMs for each dialect. We show that simply pooling the data from all dialects into one LAS model falls behind the performance of a model fine-tuned on each dialect. We then look at incorporating dialect-specific information into the model, both by modifying the training targets by inserting the dialect symbol at the end of the original grapheme sequence and also feeding a 1-hot representation of the dialect information into all layers of the model. Experimental results on seven English dialects show that our proposed system is effective in modeling dialect variations within a single LAS model, outperforming a LAS model trained individually on each of the seven dialects by 3.1 ~ 16.5% relative.

연구 동기 및 목표

  • 각 다이얼렉트별 별도의 음성 모델, 발음 모델, 언어 모델을 사용하지 않고, 여러 영어 다이얼렉트를 위한 단일 종단간 ASR 모델을 훈련하는 데 도전하는 것.
  • 명시적인 다이얼렉트 정보가 다중 다이얼렉트 모델과 다이얼렉트 전용 모델 간의 성능 격차를 줄일 수 있는지 조사하는 것.
  • 다이얼렉트 간 공유된 파rameter 학습을 통해 특히 자원이 적은 다이얼렉트의 인식 정확도를 향상시키는 것.
  • 1-핫 다이얼렉트 벡터를 인코더 및 디코더 레이어에 통합하는 것과 학습된 임베딩을 사용하는 클러스터 적응형 훈련(CAT) 간의 효과를 평가하는 것.

제안 방법

  • 모든 LAS 인코더 및 디코더 레이어에 1-핫 인코딩된 다이얼렉트 식별자를 입력 벡터로 통합하여, 다이얼렉트별 음성 및 언어적 편향을 모델링한다.
  • 훈련 타겟을 수정하여 각 참조 번역 시퀀스 끝에 다이얼렉트 이름을 접미사로 첨부함으로써, 그래프램과 다이얼렉트 정체성의 공동 예측을 가능하게 한다.
  • 다이얼렉트 인식 지도 하에 입력 스펙트로그램과 출력 문자 시퀀스 간의 어텐션 기반 정렬을 사용하여, 종단간으로 LAS 모델을 훈련한다.
  • 일곱 개인 영어 다이얼렉트인 US, IN, GB, ZA, AU, NG, KE에서 단어 오류율(WER)을 사용해 성능을 평가한다.
  • 두 가지 주입 전략을 비교한다: 직접 1-핫 벡터 주입과 공유된 파rameter를 향상시키기 위한 학습된 임베딩을 사용하는 클러스터 적응형 훈련(CAT).
  • 다이얼렉트 벡터 주입과 공동 다이얼렉트 식별을 조합하여, 모델 성능에 미치는 상호보완적 효과를 평가한다.

실험 결과

연구 질문

  • RQ1여러 영어 다이얼렉트의 데이터를 통합하여 훈련한 단일 LAS 모델이 각 다이얼렉트별로 별도로 훈련된 모델보다 성능이 뛰어나게 되는가?
  • RQ2인코더 및 디코더 레이어에 1-핫 다이얼렉트 벡터를 주입하는 것이, 기준 풀링 모델 대비 다중 다이얼렉트 ASR 성능 향상에 기여하는가?
  • RQ3학습된 임베딩을 사용하는 클러스터 적응형 훈련(CAT)에서 다이얼렉트 벡터를 클러스터 계수로 사용하는 것이 직접 1-핫 입력 주입보다 얼마나 효과적인가?
  • RQ4명시적인 다이얼렉트 지도를 통해 모델이 다이얼렉트 특화 어휘(예: 'color' 대비 'colour')를 학습할 수 있는가?
  • RQ5다이얼렉트 벡터의 포함 여부가 특히 자원이 적은 다이얼렉트에서의 일반화 능력을 향상시키는가?

주요 결과

  • 모든 레이어에 1-핫 다이얼렉트 벡터를 주입한 제안된 다중 다이얼렉트 LAS 모델(S7)은 일곱 개인 다이얼렉트에서 모두 개별적으로 훈련된 모델을 능가하며, 3.1–16.5%의 상대적 WER 감소를 달성한다.
  • 디코더 레이어에 다이얼렉트 벡터를 주입한 모델(S6)은 'colour'를 영국 영어에서만 예측하고, 미국 영어 입력에서는 'color'로 전환하는 등 다이얼렉트 특화 어휘를 성공적으로 학습한다.
  • 인코더에 다이얼렉트 벡터를 주입한 경우(S5)는 풀링 기준 모델(S1)보다 성능 향상이 있으나, 인코더와 디코더 양쪽에 주입한 경우(S7)만큼 효과적이지는 않다.
  • 학습된 임베딩을 사용하는 클러스터 적응형 훈련(CAT)(S8(emb))은 일부 다이얼렉트에서 1-핫 주입보다 더 높은 성능을 내지만, 상당히 높은 추가 파arameter 비용(300만 개 추가 파arameter)을 수반한다.
  • 다이얼렉트 벡터 주입과 공동 다이얼렉트 식별을 조합한 모델(S9)은 벡터 주입만으로도 성능 향상이 이루어지므로 성능 향상이 없으며, 모델이 이미 다이얼렉트를 거의 완벽하게 예측하고 있기 때문이다(오류 < 0.001%).
  • 훈련 중 모든 다이얼렉트 간 암묵적 파arameter 공유 덕분에, 자원이 적은 다이얼렉트의 인식 품질이 크게 향상된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.