Skip to main content
QUICK REVIEW

[논문 리뷰] An Online Attention-based Model for Speech Recognition

Ruchao Fan, Pan Zhou|arXiv (Cornell University)|2018. 11. 13.
Speech Recognition and Synthesis참고 문헌 29인용 수 6
한 줄 요약

이 논문은 LAS의 이원방향 인코더와 글로벌 소프트 어텐션을 지연 시간 제어 이원방향 LSTM과 적응형 단조적 청크 단위 어テン션으로 대체하는 온라인 어텐션 기반 음성 인식 모델인 LC-AMoChA를 제안한다. 중국어 코퍼스에서 오프라인 기준 대비 단지 3.5% 상대적 WER 저하를 달성한다.

ABSTRACT

Attention-based end-to-end models such as Listen, Attend and Spell (LAS), simplify the whole pipeline of traditional automatic speech recognition (ASR) systems and become popular in the field of speech recognition. In previous work, researchers have shown that such architectures can acquire comparable results to state-of-the-art ASR systems, especially when using a bidirectional encoder and global soft attention (GSA) mechanism. However, bidirectional encoder and GSA are two obstacles for real-time speech recognition. In this work, we aim to stream LAS baseline by removing the above two obstacles. On the encoder side, we use a latency-controlled (LC) bidirectional structure to reduce the delay of forward computation. Meanwhile, an adaptive monotonic chunk-wise attention (AMoChA) mechanism is proposed to replace GSA for the calculation of attention weight distribution. Furthermore, we propose two methods to alleviate the huge performance degradation when combining LC and AMoChA. Finally, we successfully acquire an online LAS model, LC-AMoChA, which has only 3.5% relative performance reduction to LAS baseline on our internal Mandarin corpus.

연구 동기 및 목표

  • LAS와 같은 엔드 투 엔드 어텐션 기반 음성 인식 모델에서 실시간 스트리밍 추론을 가능하게 하기 위해.
  • 이원방향 인코더와 글로벌 소프트 어텐션 메커니즘으로 인해 발생하는 지연 시간 병목 현상을 극복하기 위해.
  • 음성 특성에 따라 청크 크기를 동적으로 적응시키는 어텐션 메커니즘을 개발하여 더 나은 스트리밍 성능를 확보하기 위해.
  • 온라인 ASR에서 지연 시간 제어 인코딩과 적응형 어텐션을 결합할 때 성능 저하를 최소화하기 위해.

제안 방법

  • LAS의 표준 이원방향 LSTM 인코더를 지연 시간 제어(LC) 이원방향 LSTM으로 교체하여 향후 계산 지연을 감소시킨다.
  • 고정 크기의 청크 대신 피드포워드 네트워크를 사용해 가변적인 청크 길이를 예측하는 적응형 단조적 청크 단위 어텐션(AMoChA)을 도입한다.
  • 두 가지 보완 기법을 적용한다: (1) 향후 리스너 특징의 평균화와 (2) 향후 어텐션 확률의 평균화를 통해 정렬 경계를 안정화시킨다.
  • LC-BLSTM와 AMoChA를 결합할 때 수렴성과 성능 향상을 위해 사전 학습된 모델을 초기화 값으로 사용한다.
  • 적응형 청크에서 에너지 점수를 계산하고 각 청크 내에서 소프트 어텐션을 적용하여 AMoChA 메커니즘을 구현한다.
  • 일방향 스펠러를 갖춘 스트리밍 LAS 프레임워크에 수정된 인코더와 어텐션 메커니즘을 통합한다.

실험 결과

연구 질문

  • RQ1지연 시간 제어 이원방향 LSTM은 온라인 LAS 시스템에서 인코더 지연을 줄이면서도 음성 인식 성능을 유지할 수 있는가?
  • RQ2적응형 청크 단위 어텐션(AMoChA)은 스트리밍 어텐션 기반 ASR에서 고정 크기 청크보다 우수한 성능을 낼 수 있는가?
  • RQ3LC-BLSTM와 AMoChA를 결합할 때 심각한 성능 저하가 발생하는 원인은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ4온라인 LAS 모델의 성능은 오프라인 기준 대비 어느 정도 유지될 수 있는가?

주요 결과

  • LC-AMoChA 모델은 중국어 음성 코퍼스에서 오프라인 LAS 기준 대비 단지 3.5% 상대적 WER 저하를 달성한다.
  • 보완 기법 없이 LC-BLSTM와 AMoChA를 조합할 경우, 어텐션 경계의 잘못된 정렬으로 인해 13.1% 상대적 WER 저하가 발생한다.
  • 두 번째 보완 기법인 10단계 동안 향후 어텐션 확률 평균화를 적용하면 LC-MoChA 모델에서 저하율이 5% 상대적으로 감소한다.
  • LC-AMoChA 모델에 동일한 보완 기법을 적용하면 최고의 성능를 기록하며, 상대적 저하율이 단지 3.5%에 그친다. 이는 제안된 접근의 효과성을 확인한다.
  • 향후 확률 평균화를 사용할 경우, LC-AMoChA의 어텐션 가중치 분포가 더 이른, 더 관련성이 높은 인코더 상태 쪽으로 성공적으로 재정렬된다.
  • 학습된 길이 예측을 통한 적응형 청크화는 스트리밍 ASR에서 정렬 안정성과 성능 향상에 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.