Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-head Monotonic Chunkwise Attention For Online Speech Recognition

Baiji Liu, Songjun Cao|arXiv (Cornell University)|2020. 05. 01.
Speech Recognition and Synthesis참고 문헌 22인용 수 13
한 줄 요약

이 논문은 고정 크기의 입력 청크에 대해 다중 헤드 어텐션을 적용함으로써 MoChA를 개선한 온라인 음성 인식 모델인 다중 헤드 단조적 청크 어텐션(MTH-MoChA)을 제안한다. 이로 인해 효율적인 스트리밍 추론이 가능해졌으며, LSTM 풀링, SpecAugment, 최소 단어 오류율(MWER) 학습과 같은 추가적인 학습 전략을 통해 18,000시간 분량의 차량 내 데이터셋에서 문자 오류율(CER)을 7.28%로 낮추어 최신 하이브리드 시스템을 능가한다.

ABSTRACT

The attention mechanism of the Listen, Attend and Spell (LAS) model requires the whole input sequence to calculate the attention context and thus is not suitable for online speech recognition. To deal with this problem, we propose multi-head monotonic chunk-wise attention (MTH-MoChA), an improved version of MoChA. MTH-MoChA splits the input sequence into small chunks and computes multi-head attentions over the chunks. We also explore useful training strategies such as LSTM pooling, minimum world error rate training and SpecAugment to further improve the performance of MTH-MoChA. Experiments on AISHELL-1 data show that the proposed model, along with the training strategies, improve the character error rate (CER) of MoChA from 8.96% to 7.68% on test set. On another 18000 hours in-car speech data set, MTH-MoChA obtains 7.28% CER, which is significantly better than a state-of-the-art hybrid system.

연구 동기 및 목표

  • 표준 어텐션 메커니즘이 온라인 음성 인식에서 전체 입력 시퀀스를 수신한 후에야 출력을 생성해야 하는 한계를 해결하기 위해.
  • 단일 헤드 어텐션과 청크당 제한된 컨텍스트로 인해 제약을 받는 단조적 청크별 어텐션(MoChA)의 표현력과 성능을 향상시키기 위해.
  • 외부 언어 모델을 사용하지 않고도 경쟁 가능한 성능을 달성하는 스트리밍 엔드 투 엔드 ASR 모델을 개발하기 위해.
  • MTH-MoChA와 보완적인 학습 전략의 효과를 저자원(AISHELL-1) 및 대규모(InCar) 데이터셋에서 평가하기 위해.

제안 방법

  • MTH-MoChA는 인코더의 은닉 상태 시퀀스를 고정 크기의 청크로 나누고, 이러한 청크들에 대해 다중 헤드 어텐션을 적용하여 동시에 여러 관련 영역에 주목할 수 있도록 한다.
  • 모델은 어텐션 헤드 간에 공유 파라미터를 사용하여 정확도를 향상시키고 과적합을 줄이며 동시에 계산 효율성을 유지한다.
  • 인코더 레이어 간에 LSTM 풀링을 적용하여 시퀀스 길이를 줄이고 추론 시 계산 비용을 낮춘다.
  • 학습 중에 SpecAugment를 사용하여 스펙트로그램 특징을 증강하고 일반화 능력을 향상시킨다.
  • 레이블 스무딩과 최소 단어 오류율(MWER) 학습을 적용하여 모델의 강인성 향상과 단어 수준 오류 지표에 맞는 최적화를 달성한다.
  • 모델는 Lingvo 툴킷을 사용하여 학습되고 AISHELL-1 및 두 개의 차량 내 데이터셋(InCar2000 및 InCar18000)에서 평가된다.

실험 결과

연구 질문

  • RQ1고정 크기의 청크에 대해 다중 헤드 어텐션을 적용하면 온라인 음성 인식에서 단조적 청크별 어텐션(MoChA)의 성능 향상이 가능한가?
  • RQ2어텐션 헤드 간에 공유 파라미터를 사용하면 스트리밍 ASR에서 모델의 강인성과 일반화 능력 향상에 기여하는가?
  • RQ3SpecAugment, 레이블 스무딩, MWER 학습과 같은 학습 전략이 MTH-MoChA의 성능 향상에 어느 정도 기여하는가?
  • RQ4외부 언어 모델 없이도 MTH-MoChA는 TDNN-OPGRU와 같은 강력한 하이브리드 시스템을 능가할 수 있는가?
  • RQ5짧은 발화 길이와 복잡한 어휘를 가진 실제 도메인의 대규모 차량 내 음성 데이터에서 MTH-MoChA는 어떻게 스케일링되는가?

주요 결과

  • AISHELL-1 테스트 세트에서 최적화된 학습을 적용한 MTH-MoChA는 기존 MoChA의 CER 8.96%에서 7.68%로 감소하여 기준 모델 대비 유의미한 향상을 보였다.
  • 18,000시간 분량의 차량 내 데이터셋에서 MTH-MoChA는 CER 7.28%를 기록하여 LF-MMIE 기준으로 학습된 최신 하이브리드 시스템을 능가했다.
  • LSTM 풀링과 MWER 학습의 조합은 기존 MTH-MoChA 모델 대비 InCar18000 데이터셋에서 CER을 9.09% 상대적으로 감소시켰다.
  • InCar2000 데이터셋에서는 MTH-MoChA가 MoChA 대비 CER을 21.62% 상대적으로 감소시켜 짧은 발화에서 뚜렷한 성능 향상을 보였다.
  • 외부 언어 모델 없이도 경쟁 가능한 성능를 달성하여 엔드 투 엔드 스트리밍 ASR에서 강력한 내재적 모델링 능력을 보여주었다.
  • 결과는 MTH-MoChA가 발화 길이가 짧고 어휘가 다양한 저자원 및 실제 도메인의 차량 내 환경에서 특히 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.