Skip to main content
QUICK REVIEW

[논문 리뷰] Low Latency End-to-End Streaming Speech Recognition with a Scout Network

Chengyi Wang, Yu Wu|arXiv (Cornell University)|2020. 03. 23.
Speech Recognition and Synthesis참고 문헌 31인용 수 22
한 줄 요약

이 논문은 실시간으로 단어 경계를 탐지하는 스카우트 네트워크(SN)를 사용하여 저지연 시간 엔드 투 엔드 스트리밍 음성 인식 시스템을 제안한다. 이를 통해 인식 네트워크(RN)가 볼록한 봉우리 창을 동적으로 조정할 수 있다. SN의 경계 예측을 활용함으로써, LibriSpeech에서 639ms의 프레임 단위 지연 시간으로도 최고 성능(WER 2.7% (test-clean), 6.4% (test-other))을 달성하며, 높은 정확도를 유지하면서 지연 시간을 크게 감소시켰다.

ABSTRACT

The attention-based Transformer model has achieved promising results for speech recognition (SR) in the offline mode. However, in the streaming mode, the Transformer model usually incurs significant latency to maintain its recognition accuracy when applying a fixed-length look-ahead window in each encoder layer. In this paper, we propose a novel low-latency streaming approach for Transformer models, which consists of a scout network and a recognition network. The scout network detects the whole word boundary without seeing any future frames, while the recognition network predicts the next subword by utilizing the information from all the frames before the predicted boundary. Our model achieves the best performance (2.7/6.4 WER) with only 639 ms latency on the test-clean and test-other data sets of Librispeech.

연구 동기 및 목표

  • 고정된 봉우리 창을 기반으로 하는 스트리밍 Transformer ASR 모델의 높은 지연 시간 문제를 해결하기 위해.
  • 실제 단어 경계에 기반해 동적으로 컨텍스트 창을 조정함으로써 스트리밍 환경에서의 인식 정확도를 향상시키기 위해.
  • 학습 가능한 경계 탐지 메커니즘을 통해 지연 시간과 단어 오류률(WER) 사이의 탄력적인 트레이드오프를 가능하게 하기 위해.
  • 고정된 청크 또는 고정된 창 기반 스트리밍 접근 방식에 비해 계산 및 아키텍처 오버헤드를 줄이기 위해.

제안 방법

  • 미래의 컨텍스트 없이 실시간으로 프레임 단위 경계 분류(단어 시작/종료)를 수행하는 스카우트 네트워크(SN)를 도입하여 지연 시간 오버헤드가 없도록 보장한다.
  • 강제 정렬(forced alignment)을 정답으로 삼아 시퀀스 레이블링 작업으로 SN을 훈련시키며, 임계값 기반 결정을 통해 단어 세그먼트를 정의한다.
  • SN이 예측한 단어 경계를 기반으로 인식 네트워크(RN)가 예측된 경계까지 동적으로 적응 가능한 봉우리 창을 적용한다.
  • SN의 예측 경계를 기반으로 프레임 동기화, 일회성 디코딩이 가능한 트리거-어텐션(TA) 기반의 Transformer 모델을 RN으로 사용한다. 컨텍스트는 예측된 단어 경계까지 제한된다.
  • SN의 출력 확률에 임계값을 적용하여 정밀도/재현율 트레이드오프를 제어하고, 지연 시간-WER 튜닝을 가능하게 한다.
  • 예측된 경계와 기준(골든) 경계 간의 차이를 기반으로 프레임 단위 및 단어 단위 지연 시간 메트릭을 계산한다.
Figure 1: A comparison between three Transformer based streaming models.
Figure 1: A comparison between three Transformer based streaming models.

실험 결과

연구 질문

  • RQ1신경망 기반의 경계 탐지 컴ponent가 인식 정확도를 희생시키지 않고 스트리밍 엔드 투 엔드 ASR의 지연 시간을 줄일 수 있는가?
  • RQ2고정 창 또는 청크 기반 접근 방식에 비해 동적이고 경계 인식 기반의 봉우리 창은 지연 시간과 WER 측면에서 어떻게 비교되는가?
  • RQ3단어 경계 탐지의 정밀도가 최종 인식 성능에 얼마나 큰 영향을 미치는가?
  • RQ4기본 단어 경계가 오프라인 모델조차도 초월할 수 있는가?

주요 결과

  • 제안된 방법은 LibriSpeech test-clean에서 2.7%, test-other에서 6.4%의 최고 성능(WER)을 달성하며, 639ms의 프레임 단위 지연 시간을 유지한다.
  • 고정된 SN 임계값(σ=0.9)을 사용할 경우 WER는 clean에서 2.9%, other에서 7.4%로 감소하며, 619ms의 낮은 지연 시간을 유지한다. 이는 2190ms의 지연 시간을 가지는 고정 창 TA 기반 베이스라인을 능가한다.
  • 골든 단어 경계를 사용한 모델은 2.1%와 5.3%의 WER를 기록하며, 오프라인 모델을 초월한다. 이는 정확한 경계 정보의 가치를 입증한다.
  • SN의 임계값을 높일수록 경계 정밀도는 증가하고 재현율은 감소하여 WER가 낮아지며, 이는 개선된 경계 탐지가 인식 품질 향상에 기여함을 확인한다.
  • 138M 파라미터를 가진 대규모 모델은 LibriSpeech에서 스트리밍 E2E ASR의 새로운 SOTA 기록인 2.7%와 6.4%의 WER를 달성한다.
  • 단어 단위 지연 시간은 평균 352ms로, 시스템이 매우 반응성이 높고 실시간 응용에 적합함을 시사한다.
Figure 2: The distribution of segment length for different threshold. The blue area shows the density. The deep blue lines represent the mean values. The white markers represent the median values and the black vertical lines represent the interquartile ranges.
Figure 2: The distribution of segment length for different threshold. The blue area shows the density. The deep blue lines represent the mean values. The white markers represent the median values and the black vertical lines represent the interquartile ranges.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.