Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Multi-speaker Speech Recognition with Transformer

Xuankai Chang, Wangyou Zhang|arXiv (Cornell University)|2020. 02. 10.
Speech Recognition and Synthesis참고 문헌 28인용 수 5
한 줄 요약

이 논문은 단일 및 다중 채널 환경에서 엔드 투 엔드 다중 발화자 음성 인식을 위해 Transformer 모델을 사용하며, ASR 백엔드에서 RNN을 대체하고, 계산 효율성을 위해 자기주의를 국소 세그먼트로 제한하는 방법을 제안한다. 단일 채널 및 다중 채널 환경에서 각각 40.9% 및 25.6%의 상대적 WER 감소를 달성했으며, 외부 WPE 역반사 제거 처리를 결합한 경우 반사 환경에서 각각 41.5% 및 13.8%의 상대적 WER 감소를 기록했다.

ABSTRACT

Recently, fully recurrent neural network (RNN) based end-to-end models have been proven to be effective for multi-speaker speech recognition in both the single-channel and multi-channel scenarios. In this work, we explore the use of Transformer models for these tasks by focusing on two aspects. First, we replace the RNN-based encoder-decoder in the speech recognition model with a Transformer architecture. Second, in order to use the Transformer in the masking network of the neural beamformer in the multi-channel case, we modify the self-attention component to be restricted to a segment rather than the whole sequence in order to reduce computation. Besides the model architecture improvements, we also incorporate an external dereverberation preprocessing, the weighted prediction error (WPE), enabling our model to handle reverberated signals. Experiments on the spatialized wsj1-2mix corpus show that the Transformer-based models achieve 40.9% and 25.6% relative WER reduction, down to 12.1% and 6.4% WER, under the anechoic condition in single-channel and multi-channel tasks, respectively, while in the reverberant case, our methods achieve 41.5% and 13.8% relative WER reduction, down to 16.5% and 15.2% WER.

연구 동기 및 목표

  • 단일 및 다중 채널 설정 모두에서 엔드 투 엔드 ASR 모델의 RNN 기반 인코더-디코더를 Transformer 아키텍처로 대체하여 다중 발화자 음성 인식 성능을 향상시키는 것.
  • 장기 시퀀스 신호 처리에서 표준 Transformer의 높은 메모리 소비 문제를 해결하기 위해 신경 빔포머 프론트엔드에서 자기주의를 국소적 시간 윈도우로 제한하는 것.
  • 외부 WPE 역반사 제거 전처리 단계를 통합하여 반사 환경에서의 강인성을 향상시키는 것.
  • 공간화된 WSJ1-2mix 코퍼스를 사용하여 반사 및 반사 없는 조건에서 제안된 아키텍처의 효과를 평가하는 것.

제안 방법

  • 단일 및 다중 채널 설정 모두에서 엔드 투 엔드 ASR 모델의 RNN 기반 인코더-디코더를 Transformer 아키텍처로 대체한다.
  • 신경 빔포머의 마스킹 네트워크에서 자기주의 메커니즘을 국소 시간 윈도우 내에서만 작동하도록 수정하여 메모리 및 계산 비용을 감소시킨다.
  • 가중 예측 오차(WPE) 알고리즘을 외부 전처리 단계로 통합하여 ASR 모델 입력 이전에 공간 반사 효과를 감소시킨다.
  • Joint CTC 및 교차 엔트로피 손실을 사용하여 엔드 투 엔드 시스템을 훈련시키며, Transformer 백엔드가 분리된 음성 스트림을 인식하도록 학습한다.
  • 혼합 신호에서 다수의 발화자를 구분하기 위해 주요 인식 인코더 이전에 발화자 식별 인코더를 사용한다.
  • 반사 없는 및 역반사 처리된 훈련 데이터를 결합하여 다중 조건 훈련을 수행함으로써 실제 환경 조건에서의 강인성을 향상시킨다.

실험 결과

연구 질문

  • RQ1Transformer가 단일 및 다중 채널 음성 인식 환경에서 엔드 투 엔드 다중 발화자 ASR에서 RNN을 초월할 수 있는가?
  • RQ2성능을 훼손하지 않고 장기 시퀀스 신호 처리에서 자기주의의 계산 비용을 어떻게 줄일 수 있는가?
  • RQ3외부 WPE 역반사 제거 처리를 Transformer 기반 모델과 결합했을 때 반사 환경에서 ASR 성능 향상 정도는 어느 정도인가?
  • RQ4완전히 Transformer 기반 프론트엔드(Masking Network)가 다중 채널 다중 발화자 인식에서 RNN 기반 프론트엔드를 능가하는가?
  • RQ5제안된 모델의 성능은 반사 및 반사 없는 조건에서 이전의 RNN 기반 시스템과 비교해 어떻게 다른가?

주요 결과

  • 단일 채널 반사 없는 조건에서 Transformer 기반 모델은 평가 세트에서 12.1% WER을 기록하며 상대적 WER 감소율 40.9%를 달성했다.
  • 다중 채널 반사 없는 조건에서는 상대적 WER 감소율 25.6%를 기록하며 평가 세트에서 WER이 6.4%에 도달했다.
  • 반사 조건에서 단일 채널 설정에서는 상대적 WER 감소율 41.5%를 기록했으며, WPE 전처리 후 WER이 28.21%에서 16.50%로 감소했다.
  • WPE 전처리를 적용한 다중 채널 모델은 상대적 WER 감소율 13.8%를 기록했으며, 평가 WER이 15.24%로 낮아졌다.
  • 완전히 Transformer 기반 프론트엔드는 반사 조건에서 성능이 약간 떨어졌는데, 이는 제한된 주의 윈도우 크기(~0.3초)로 인한 것으로 보이며, 아키텍처 개선 여지가 있음을 시사한다.
  • WPE 전처리와 Transformer 백엔드의 조합은 강인성을 크게 향상시켜 반사 없는 조건과 반사 조건 간의 성능 격차를 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.