Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-End Dereverberation, Beamforming, and Speech Recognition with Improved Numerical Stability and Advanced Frontend

Wangyou Zhang, Christoph Boeddeker|arXiv (Cornell University)|2021. 02. 23.
Speech and Audio Processing참고 문헌 47인용 수 33
한 줄 요약

이 논문은 다채널, 다화자, 반향 환경에서 종단간 프레임워크를 제안한다. 반향 제거, beamforming, 음성 인식을 동시에 수행한다. 수치적 안정화 기법 네 가지—대각선 로딩, 마스크 바닥값 설정, 안정적인 복소수 연산, 双정밀도 계산—와 VAD 유사 마스크를 도입하여 주파수 순열 문제를 완화함으로써, 기존 종단간 ASR 대비 35% 상대적 WER 감소를 달성하고, 오직 ASR 감독 신호만으로도 SDR = 12.5 dB의 뛰어난 음성 증강 성능을 확보한다.

ABSTRACT

Recently, the end-to-end approach has been successfully applied to multi-speaker speech separation and recognition in both single-channel and multichannel conditions. However, severe performance degradation is still observed in the reverberant and noisy scenarios, and there is still a large performance gap between anechoic and reverberant conditions. In this work, we focus on the multichannel multi-speaker reverberant condition, and propose to extend our previous framework for end-to-end dereverberation, beamforming, and speech recognition with improved numerical stability and advanced frontend subnetworks including voice activity detection like masks. The techniques significantly stabilize the end-to-end training process. The experiments on the spatialized wsj1-2mix corpus show that the proposed system achieves about 35% WER relative reduction compared to our conventional multi-channel E2E ASR system, and also obtains decent speech dereverberation and separation performance (SDR=12.5 dB) in the reverberant multi-speaker condition while trained only with the ASR criterion.

연구 동기 및 목표

  • 반향이 강하고 소음이 많은 다화자 환경에서 종단간 ASR의 심각한 성능 저하 문제를 해결한다.
  • WPE 및 beamformer 연산에서 발생하는 수치적 불안정성을 해결함으로써, 종단간 반향 제거, beamforming, ASR의 훈련을 안정화한다.
  • 훈련에 오직 전사본만을 사용하여 도전적인 칵테일 파티 상황에서의 음성 증강 및 인식 성능을 향상시킨다.
  • WPE 및 beamformer에 대해 VAD 유사 마스크를 사용하여 종단간 훈련 시 주파수 순열 문제를 완화한다.
  • 단일 종단간 시스템이 별도의 프론트엔드 훈련 없이도 반향 제거, 분離, 인식에서 뛰어난 성능을 달성할 수 있음을 입증한다.

제안 방법

  • WPE 및 beamformer에서의 행렬 역행렬 계산을 안정화하기 위해 대각선 로딩, 마스크 바닥값 설정, 안정적인 복소수 연산, 이중 정밀도 계산의 네 가지 수치적 안정화 기법을 도입한다.
  • WPE 및 beamformer 마스크를 생성하기 위해 공유된 마스크 추정기(MaskNet)를 사용하여 공동 최적화를 가능하게 한다.
  • DNN-WPE를 통한 반향 제거와 MVDR/wMPDR beamformer를 통한 공간 필터링을 위한 인과적 프론트엔드 아키텍처를 구현한다.
  • 비음성 성분을 억제하고 종단간 훈련 중 주파수 순열을 감소시키기 위해 VAD 유사 마스크를 적용한다.
  • 오직 전사본만을 사용하여 프론트엔드와 함께 종단간으로 훈련되는 연속 CTC/attention 기반 ASR 백엔드를 사용한다.
  • 예측된 음성 표현과 타겟 표현을 정렬하기 위해 PIT 기반 손실 함수를 사용하여 전체 시스템을 최적화한다.

실험 결과

연구 질문

  • RQ1WPE 및 beamformer 연산에서 발생하는 수치적 불안정성은 종단간 반향 제거 및 ASR 훈련에서 효과적으로 완화될 수 있는가?
  • RQ2VAD 유사 마스크의 사용은 주파수 순열을 감소시키고 음성 증강 및 인식 성능을 향상시키는가?
  • RQ3오직 ASR 감독 신호만으로도 단일 종단간 시스템이 반향 제거, beamforming, ASR를 공동 최적화할 수 있는가?
  • RQ4다양한 beamformer 변종(MVDR 대비 wMPDR)이 반향 환경에서 종단간 훈련 시 어떻게 비교되는가?
  • RQ5제안된 안정화 기법들이 다화자 반향 환경에서 WER, SDR, PESQ, STOI 지표에 어떤 영향을 미치는가?

주요 결과

  • 제안된 시스템은 공간화된 wsj1-2mix 코퍼스에서 기존의 다채널 종단간 ASR 시스템 대비 35% 상대적 WER 감소를 달성한다.
  • 시스템은 음성 증강 SDR 12.5 dB 및 PESQ 1.97을 달성하여 강력한 반향 제거 및 분리 성능를 입증한다.
  • 대각선 로딩, 마스크 바닥값 설정, 안정적인 복소수 연산, 이중 정밀도 계산의 네 가지 안정화 기법 조합이 가장 우수한 수렴 및 성능을 보였다.
  • VAD 유사 마스크는 PESQ(1.95), STOI(0.86), SDR(12.54 dB)를 크게 향상시켜 주파수 순열 영향을 감소시켰다.
  • VAD 유사 마스크를 적용한 wMPDR beamformer가 가장 낮은 WER 9.44% 및 SDR 8.49 dB를 기록하여 MVDR 기반 모델을 능가했다.
  • VAD 유사 마스크와 안정화 기법을 적용한 제안된 프레임워크는 청소된 WSJ eval92 기준(4.4% WER)에 근접한 최상위 성능(9.45% WER)을 달성하여 강력한 일반화 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.