Skip to main content
QUICK REVIEW

[논문 리뷰] Emformer: Efficient Memory Transformer Based Acoustic Model For Low Latency Streaming Speech Recognition

Yangyang Shi, Yongqiang Wang|arXiv (Cornell University)|2020. 10. 21.
Speech Recognition and Synthesis참고 문헌 31인용 수 13
한 줄 요약

이 논문은 키/값 캐싱과 최적화된 메모리 백업 전파를 통해 계산을 줄이는 메모리 강화된 Transformer 아키텍처인 Emformer를 제안한다. Emformer는 평균 지연 시간 960ms 이내에서 LibriSpeech test-clean에서 2.50%의 WER, test-other에서 5.62%의 WER를 기록하며 최신 기술 수준을 달성했으며, AM-TRF 대비 4.6배 빠른 학습 속도와 18% 낮은 디코딩 RTF를 확보했다.

ABSTRACT

This paper proposes an efficient memory transformer Emformer for low latency streaming speech recognition. In Emformer, the long-range history context is distilled into an augmented memory bank to reduce self-attention's computation complexity. A cache mechanism saves the computation for the key and value in self-attention for the left context. Emformer applies a parallelized block processing in training to support low latency models. We carry out experiments on benchmark LibriSpeech data. Under average latency of 960 ms, Emformer gets WER $2.50\%$ on test-clean and $5.62\%$ on test-other. Comparing with a strong baseline augmented memory transformer (AM-TRF), Emformer gets $4.6$ folds training speedup and $18\%$ relative real-time factor (RTF) reduction in decoding with relative WER reduction $17\%$ on test-clean and $9\%$ on test-other. For a low latency scenario with an average latency of 80 ms, Emformer achieves WER $3.01\%$ on test-clean and $7.09\%$ on test-other. Comparing with the LSTM baseline with the same latency and model size, Emformer gets relative WER reduction $9\%$ and $16\%$ on test-clean and test-other, respectively.

연구 동기 및 목표

  • 스트리밍 Transformer의 높은 계산 비용과 느린 학습을 유발하는 중복된 왼쪽 컨텍스트 계산 문제를 해결하기 위해.
  • 확장된 메모리 Transformer에서 반복적인 어텐션 계산을 제거하여 스트리밍 ASR의 지연 시간을 줄이기 위해.
  • 계층 간 메모리 백업 전파 방식을 재정의하여 저지연 모델의 블록 병렬 학습을 가능하게 하기 위해.
  • 요약 벡터와 메모리 백업 간의 어텐션을 비활성화하여 먼 컨텍스트에 대한 과도한 강조를 방지하고 학습을 안정화하기 위해.
  • 중간 및 저지연 조건 하에서 LibriSpeech에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 이전 세그먼트의 자기주의 주의 계산을 저장하고 재사용할 수 있는 키/값 캐시 메커니즘을 도입하여 왼쪽 컨텍스트에 대한 중복 계산을 제거한다.
  • 계층 단위에서 깊이 단위로 메모리 백업 전파 방식을 재구성하여, 하위 계층에서 상위 계층으로 메모리 백업을 전달함으로써 순차적 처리의 병목 현상을 방지한다.
  • 요약 벡터와 메모리 백업 간의 어텐션을 비활성화하여 장거리 컨텍스트, 특히 잡음이 섞인 컨텍스트에 대한 과도한 강조를 방지한다.
  • 학습 중 세그먼트 처리를 메모리 백업에 순차적 의존성에서 분리하여 블록 병렬 처리를 적용한다.
  • 입력 시퀀스를 중심, 왼쪽, 오른쪽 컨텍스트 블록으로 블록 단위로 청킹하여 제어 가능한 지연 시간을 갖는 스트리밍 추론을 지원한다.
  • 하이브리드 및 신경 전이기반 ASR 프레임워크에 모델를 통합하여 다양한 모델링 철학에 대한 성능 안정성을 평가한다.

실험 결과

연구 질문

  • RQ1메모리 강화된 Transformer 아키텍처가 스트리밍 자기주의 주의에서 계산의 중복을 줄이면서도 ASR 정확도를 유지할 수 있는가?
  • RQ2블록 병렬 처리를 가능하게 하는 아키텍처 수정을 통해 확장된 메모리 Transformer의 학습 속도를 크게 향상시킬 수 있는가?
  • RQ3계층 단위에서 깊이 단위로 메모리 백업 전파 방식을 재정의하면 학습 안정성과 추론 효율성이 향상되는가?
  • RQ4Emformer가 80ms와 같은 저지연 조건 하에서 LibriSpeech에서 최신 기술 수준의 WER를 달성하면서도 낮은 디코딩 RTF를 유지할 수 있는가?
  • RQ5LCBLSTM 및 AM-TRF와 같은 강력한 베이스라인과 비교했을 때, Emformer는 다양한 지연 설정에서 WER, 학습 속도, 디코딩 효율성 측면에서 어떤 성능을 보이는가?

주요 결과

  • 평균 지연 시간 960ms 이내에서 Emformer는 LibriSpeech test-clean에서 2.50%의 WER, test-other에서 5.62%의 WER를 기록했으며, AM-TRF 베이스라인 대비 각각 17%와 9%의 상대적 WER 감소를 달성했다.
  • Emformer는 AM-TRF 대비 18% 낮은 디코딩 RTF를 기록했으며, 960ms 지연 시간에서 RTF 0.13을 달성했다.
  • 학습 중 블록 병렬 처리가 가능해진 덕분에 Emformer는 AM-TRF 대비 4.6배 빠른 학습 속도를 확보했다.
  • 평균 지연 시간 80ms 이내에서 Emformer는 test-clean에서 3.01%의 WER, test-other에서 7.09%의 WER를 기록했으며, LibriSpeech에서 저지연 스트리밍 ASR의 새로운 최신 기술 수준을 수립했다.
  • 유사한 지연 시간과 모델 크기를 가진 LSTM 베이스라인과 비교했을 때, Emformer는 test-clean에서 WER을 9% 감소시키고 test-other에서는 16% 감소시켰다.
  • sMBR 학습을 적용했을 때, Emformer는 960ms 지연 시간에서 test-clean에서 2.50%의 WER, test-other에서 5.62%의 WER를 기록했으며, 다양한 모델 아키텍처에 걸쳐 강력한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.