Skip to main content
QUICK REVIEW

[논문 리뷰] Developing Real-time Streaming Transformer Transducer for Speech Recognition on Large-scale Dataset

Xie Chen, Yu Wu|arXiv (Cornell University)|2020. 10. 22.
Speech Recognition and Synthesis참고 문헌 34인용 수 9
한 줄 요약

이 논문은 대규모 음성 인식을 위한 실시간 스트리밍 Transformer Transducer (T-T) 및 Conformer Transducer (C-T) 모델을 제안하며, Transformer-XL과 청크 기반 처리를 결합하여 정확도를 훼손하지 않은 채 저지연 추론을 가능하게 한다. 이 방법은 360ms의 레이트레이트를 가진 CPU에서 0.25 실시간 요소를 달성하여 RNN-T 및 스트리밍 Transformer AED 모델보다 상대적으로 10% 이상 WER를 향상시키며, 효율적인 계산을 유지한다.

ABSTRACT

Recently, Transformer based end-to-end models have achieved great success in many areas including speech recognition. However, compared to LSTM models, the heavy computational cost of the Transformer during inference is a key issue to prevent their applications. In this work, we explored the potential of Transformer Transducer (T-T) models for the fist pass decoding with low latency and fast speed on a large-scale dataset. We combine the idea of Transformer-XL and chunk-wise streaming processing to design a streamable Transformer Transducer model. We demonstrate that T-T outperforms the hybrid model, RNN Transducer (RNN-T), and streamable Transformer attention-based encoder-decoder model in the streaming scenario. Furthermore, the runtime cost and latency can be optimized with a relatively small look-ahead.

연구 동기 및 목표

  • 스트리밍 음성 인식에서 Transformer Transducer (T-T) 모델의 높은 계산 비용과 지연을 해결하기 위해.
  • 저지연과 높은 정확도를 유지하면서 대규모 데이터셋에서 실시간 추론을 가능하게 하기 위해.
  • 스트리밍 ASR 시스템에서 훈련 효율성, 런타임 비용, 모델 성능 간의 균형을 이루기 위해.
  • 시간 제한 마스킹, 청크 기반 처리, 메모리 기반 접근 방식 등의 기존 스트리밍 방법의 한계를 극복하기 위해.

제안 방법

  • Context 의존성을 제한하고 지연 증가를 줄이기 위해 Transformer-XL의 반복 메커니즘과 청크 기반 스트리밍 처리를 통합하기 위해.
  • 훈련 효율성을 유지하고 겹치는 청크를 방지하기 위해 고정된 이력 길이(예: 60 프레임)를 사용하기 위해.
  • 자연스러운 청크 기반 디코딩을 가능하게 하고 지연을 줄이기 위해 소규모 레이트레이트(예: 24 프레임, 720ms)를 적용하기 위해.
  • 속도와 정확도의 균형을 이루기 위해 Transformer 인코더와 LSTM 예측기의 하이브리드 아키텍처를 사용하기 위해.
  • 65,000시간의 훈련을 2일 만에 완료하기 위해 32개의 V100 GPU에서 혼합 정밀도 훈련을 적용하기 위해.
  • 특히 CPU에서의 추론 가속을 위해 INT8 정밀도 양자화를 적용하여 WER 저하를 최소한도로 줄이기 위해.

실험 결과

연구 질문

  • RQ1스트리밍 Transformer Transducer 모델이 대규모 음성 인식 데이터셋에서 저지연으로 실시간 추론을 달성할 수 있는가?
  • RQ2Transformer-XL과 청크 기반 처리를 결합함으로써 T-T 모델의 지연과 계산 효율성이 어떻게 향상되는가?
  • RQ3스트리밍 T-T 및 C-T 모델에 소규모 레이트레이트를 도입할 경우 지연, 추론 속도, 정확도 간의 상충 관계는 어떻게 되는가?
  • RQ4INT8 정밀도 양자화가 스트리밍 T-T 및 C-T 모델의 추론 속도를 크게 향상시킬 수 있으며, 성능 저하 없이 CPU에서 실행 가능한가?

주요 결과

  • T-T 및 C-T는 스트리밍 환경에서 하이브리드 모델, RNN-T, 스트리밍 Transformer AED 모델보다 상대적으로 10% 이상 WER를 향상시켰다.
  • 360ms의 레이트레이트를 가진 T-T는 CPU에서 0.25 실시간 요소를 달성하여 산업적 실시간 요구 조건을 충족시켰다.
  • 60프레임 이력과 24프레임 레이트레이트를 가진 T-T는 4개의 스레드에서 8.28% WER와 0.16 RTF를 달성하여 정확도와 효율성 면에서 RNN-T를 모두 능가했다.
  • INT8 정밀도 양자화는 RNN-T에 대해 3.6배의 속도 향상을, T-T 및 C-T에 대해서는 약 2배의 속도 향상을 가져왔으며, T-T의 경우 WER 저하가 단 0.22%에 불과했다.
  • 작은 레이트레이트 조건에서도 근사적으로 오프라인 성능(7.78% WER)을 유지하여 전체 문장 추론 대비 정확도 저하가 최소한임을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.