Skip to main content
QUICK REVIEW

[논문 리뷰] WNARS: WFST based Non-autoregressive Streaming End-to-End Speech Recognition

Zhichao Wang, Wenwen Yang|arXiv (Cornell University)|2021. 04. 08.
Speech Recognition and Synthesis참고 문헌 29인용 수 9
한 줄 요약

WNARS는 WFST 기반의 비자기적 스트리밍 엔드 투 엔드 ASR 프레임워크를 제안하며, CTC-attention 모델과 WFST 디코딩을 결합하여 자기적 어텐션 기반 모델에서 발생하는 디코딩 비효율성, 낮은 단어 수준 언어 모델 통합, 스트리밍 호환성 문제를 해결한다. 640ms 지연 시간으로 AISHELL-1에서 최고 수준의 5.22% CER를 달성하였으며, 이는 이전의 스트리밍 시스템과 10,000시간 산업 기준 모델보다 오차율 감소율 20% 이상, 지연 시간 50% 감소로 슈퍼리어한 성능을 보였다.

ABSTRACT

Recently, attention-based encoder-decoder (AED) end-to-end (E2E) models have drawn more and more attention in the field of automatic speech recognition (ASR). AED models, however, still have drawbacks when deploying in commercial applications. Autoregressive beam search decoding makes it inefficient for high-concurrency applications. It is also inconvenient to integrate external word-level language models. The most important thing is that AED models are difficult for streaming recognition due to global attention mechanism. In this paper, we propose a novel framework, namely WNARS, using hybrid CTC-attention AED models and weighted finite-state transducers (WFST) to solve these problems together. We switch from autoregressive beam search to CTC branch decoding, which performs first-pass decoding with WFST in chunk-wise streaming way. The decoder branch then performs second-pass rescoring on the generated hypotheses non-autoregressively. On the AISHELL-1 task, our WNARS achieves a character error rate of 5.22% with 640ms latency, to the best of our knowledge, which is the state-of-the-art performance for online ASR. Further experiments on our 10,000-hour Mandarin task show the proposed method achieves more than 20% improvements with 50% latency compared to a strong TDNN-BLSTM lattice-free MMI baseline.

연구 동기 및 목표

  • 자기적 비트맵 검색 디코딩의 비효율성을 해결하기 위해 어텐션 기반 엔드 투 엔드 ASR 모델에서 발생하는 문제를 해결한다.
  • 자기적 디코딩에서 어려운 단어 수준 언어 모델을 엔드 투 엔드 ASR 시스템에 효과적으로 통합할 수 있도록 한다.
  • 전체 인코더 출력을 기반으로 한 비자기적 두 번째 단계 재평가를 통해 전역 어텐션을 조각별 CTC 디코딩으로 변환함으로써 스트리밍 ASR을 지원한다.
  • 스트리밍, 비자기적 환경에서 정확도와 지연 시간을 동시에 향상시킨다.
  • CTC-attention 모델과 WFST를 조합하여 스트리밍, 확장 가능하고 프로덕션 준비가 된 ASR를 구현하는 데 효과성을 입증한다.

제안 방법

  • 프레임워크는 하이브리드 CTC-attention 아키텍처를 사용하며, CTC 브랜치는 WFST를 활용하여 효율적인 단어 수준 언어 모델 통합을 통해 첫 번째 단계 스트리밍 디코딩을 수행한다.
  • 디코더 브랜치는 CTC 브랜치에서 생성한 가설을 기반으로 전체 인코더 출력을 조건으로 삼아 비자기적 두 번째 단계 재평가를 수행한다.
  • 지연 시간과 성능의 균형을 맞추기 위해 구성 가능한 왼쪽, 중심, 오른쪽 컨텍스트 크기(N_l, N_c, N_r)를 가진 다중 청크 추론 전략을 사용한다.
  • CTC 브랜치에서 WFST 디코딩을 사용하여 첫 번째 단계 가설 생성 시에 단어 수준 언어 모델을 효율적으로 적용한다.
  • 단조적 일치를 장려하고 학습 안정성을 향상시키기 위해 하이브리드 CTC-attention 손실 함수를 사용하여 모델을 훈련한다.
  • 컨포머 기반 인코더와 디코더를 활용하며, 다중 헤드 자기 어텐션과 컨volution 모듈을 사용하여 문맥 모델링을 수행한다.

실험 결과

연구 질문

  • RQ1비자기적, 스트리밍 ASR 시스템이 낮은 지연 시간을 유지하면서도 최고 수준의 정확도를 달성할 수 있는가?
  • RQ2WFST 기반 디코딩을 사용할 경우 엔드 투 엔드 ASR 시스템에 단어 수준 언어 모델을 얼마나 효과적으로 통합할 수 있는가?
  • RQ3하이브리드 아키텍처에서 CTC와 어텐션의 조합이 정확도를 희생시키지 않고도 효율적이고 낮은 지연 시간의 스트리밍 디코딩을 가능하게 할 수 있는가?
  • RQ4다중 청크 처리 방식은 스트리밍 ASR에서 지연 시간과 인식 성능 간의 트레이드오프에 어떤 영향을 미치는가?
  • RQ5제안된 프레임워크는 대규모 실세계 환경에서 강력한 전통적 ASR 기준 모델을 초월할 수 있는가?

주요 결과

  • WNARS는 AISHELL-1 테스트 세트에서 단지 640ms의 지연 시간으로 5.22%의 문자 오류율(CER)을 달성하였으며, 유사한 지연 시간 조건에서 온라인 ASR의 최고 수준 성능을 나타낸다.
  • 960ms 지연 시간에서 비스트리밍 기준 모델(4.57% CER) 대비 0.65% 절대 CER 감소를 기록하여 지연 제약 조건에 대한 강력한 내구성을 입증하였다.
  • 1900ms 대비 50% 지연 시간 감소(960ms 대비)로, 10,000시간 모나르트어 데이터셋에서 강력한 TDNN-BLSTM LFMMI 기준 모델 대비 닫은 말하기 세트에서 20.3% CER 감소, 원거리 세트에서 20.4% CER 감소를 달성하였다.
  • 단어 수준 언어 모델 통합을 위해 WFST를 사용함으로써 문자 수준 언어 모델 통합 대비 상대적으로 10.6% CER 향상이 이루어졌으며, 이는 단어 수준 언어 모델 통합의 우수성을 확인한다.
  • 지연 시간을 960ms에서 480ms로 줄였을 때 절대 CER 감소율이 0.18%에 불과하여 지연 시간 변화에 대한 강력한 내구성을 보였다.
  • 다중 청크 전략은 다양한 지연 설정에서 안정적인 성능을 제공하였으며, 고정된 지연 시간 조건에서 오른쪽 컨텍스트(N_r)를 늘릴수록 정확도가 향상됨을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.