Skip to main content
QUICK REVIEW

[논문 리뷰] Improving the Performance of Online Neural Transducer Models

Tara N. Sainath, Chung‐Cheng Chiu|arXiv (Cornell University)|2017. 12. 05.
Topic Modeling참고 문헌 18인용 수 6
한 줄 요약

이 논문은 스트리밍 음성 인식을 위한 온라인 신경 전환자(NT) 모델을 향상시키기 위해 볼록 주시(look-back) 및 앞서 보는(look-ahead) 메커니즘을 도입하여 주의 범위를 확장하고, 사전 훈련된 LAS 모델에서 초기화하며, 워드피스와 외부 언어 모델 융합을 통해 더 강력한 언어 모델을 통합한다. 이러한 개선 사항으로 인해 300ms 지연(패킷 크기 5)을 가진 NT는 비스트리밍 LAS 모델에 비해 상대적으로 1% 이내의 WER 성능을 달성하며, 실시간 응용 프로그램에 적합한 상태로 그 정확도를 유지한다.

ABSTRACT

Having a sequence-to-sequence model which can operate in an online fashion is important for streaming applications such as Voice Search. Neural transducer is a streaming sequence-to-sequence model, but has shown a significant degradation in performance compared to non-streaming models such as Listen, Attend and Spell (LAS). In this paper, we present various improvements to NT. Specifically, we look at increasing the window over which NT computes attention, mainly by looking backwards in time so the model still remains online. In addition, we explore initializing a NT model from a LAS-trained model so that it is guided with a better alignment. Finally, we explore including stronger language models such as using wordpiece models, and applying an external LM during the beam search. On a Voice Search task, we find with these improvements we can get NT to match the performance of LAS.

연구 동기 및 목표

  • 스트리밍 음성 인식에서 온라인 신경 전환자(NT) 모델과 비스트리밍 전체 시퀀스 모델인 LAS 간의 성능 격차를 해소하기 위해.
  • NT가 낮은 지연을 유지하면서 LAS 수준의 정확도를 유지할 수 있도록 하는 아키텍처 및 훈련 개선 방법을 탐구하기 위해.
  • 워드피스와 외부 언어 모델을 포함한 더 강력한 언어 모델링의 NT 성능에 미치는 영향을 평가하기 위해.
  • LAS 모델에서 사전 훈련한 모델로 NT를 초기화하는 것이 수렴 속도와 최종 성능에 기여하는지 확인하기 위해.
  • NT가 LAS에 비해 성능 저하가 발생하는 주요 원인, 특히 언어 모델링 오류를 분석하기 위해.

제안 방법

  • NT의 주의 범위를 이전 청크에 대한 볼록 주시 및 5프레임의 앞서 보는 주의를 추가하여 확장하며, 이는 추가 지연 없이 구현된다.
  • 더 나은 정렬 감독과 빠른 수렴을 위해 NT 모델 가중치를 사전 훈련된 LAS 모델에서 초기화한다.
  • 디코더 내 언어 모델 용량을 강화하기 위해 서브워드 단위를 워드피스(WPM)로 교체한다.
  • 얕은 융합을 통해 외부 n-그램 FST 언어 모델을 NT 시스템과 융합하여 언어 모델링을 향상시킨다.
  • LAS 및 NT 모델 양쪽에 다중헤드 주의를 사용하여 표현 학습 및 주의 동역학을 향상시킨다.
  • 패킷 크기가 5(300ms)와 10(450ms)인 12,500시간 분량의 음성 검색 데이터셋에서 모델을 훈련하고 평가하여 지연-성능 트레이드오���을 분석한다.

실험 결과

연구 질문

  • RQ1NT의 주의 범위를 볼록 주시 및 앞서 보는 메커니즘으로 확장하면 LAS에 비해 성능 저하가 감소하는가?
  • RQ2사전 훈련된 LAS 모델에서 NT 모델을 사전 훈련하면 최종 성능이 크게 향상되는가?
  • RQ3워드피스 기반 서브워드 단위는 특히 낮은 패킷 크기에서 NT의 언어 모델링에 얼마나 기여하는가?
  • RQ4외부 언어 모델 융합이 NT와 LAS 간의 성능 격차를 추가로 줄일 수 있는가?
  • RQ5NT가 LAS에 비해 발생하는 주요 오류 유형은 무엇이며, 아키텍처 및 훈련 개선을 통해 이를 완화할 수 있는가?

주요 결과

  • 볼록 주시 및 앞서 보는 주의를 적용한 NT는 패킷 크기 10(450ms 지연)일 때 LAS에 비해 상대적으로 20% 이상의 WER 저하를 보이며, 향후 개선 여지가 크다는 것을 시사한다.
  • LAS 모델에서 사전 훈련한 NT는 성능 격차를 줄이며, 패킷 크기 10일 때 LAS 성능을 재현할 수 있다.
  • 워드피스(WPM)를 사용하면 NT의 언어 모델링이 크게 향상되어 패킷 크기 5와 10 모두에서 WER가 8.6으로 감소하고, LAS와의 격차가 좁혀진다.
  • NT에서 다중헤드 주의는 단일헤드 주의에 비해 성능 향상이 없으며, LAS와는 달리 스트리밍 환경에서 주의의 사용 방식에 한계가 있음을 시사한다.
  • WPM와 함께 외부 FST 언어 모델 융합은 추가적인 성능 향상 없이, 디코더 내부의 RNN-LM 용량으로 인해 효과가 없어 보인다.
  • 패킷 크기 5(300ms 지연)를 가진 최고의 NT 시스템은 LAS에 비해 상대적으로 1% 이내의 WER 저하만 보이며, 실시간 제약 조건 하에서도 거의 동등한 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.