Skip to main content
QUICK REVIEW

[논문 리뷰] Improving noise robust automatic speech recognition with single-channel time-domain enhancement network

Keisuke Kinoshita, Tsubasa Ochiai|arXiv (Cornell University)|2020. 03. 09.
Speech and Audio Processing참고 문헌 30인용 수 8
한 줄 요약

이 논문은 Conv-TasNet 기반의 단일 채널 시간 도메인 음성 정제 네트워크인 Denoising-TasNet을 제안하여 잡음에 강건한 자동 음성 인식(ASR)을 향상시킨다. 강력한 ASR 백엔드를 사용할 때, 재학습 없이도 실제 CHiME-4 테스트 데이터에서 상대적 WER를 30% 이상 감소시켜, 시간 도메인 정제 기법이 주파수 도메인 방법을 뛰어넘어 ASR 성능을 크게 향상시킬 수 있음을 입증한다.

ABSTRACT

With the advent of deep learning, research on noise-robust automatic speech recognition (ASR) has progressed rapidly. However, ASR performance in noisy conditions of single-channel systems remains unsatisfactory. Indeed, most single-channel speech enhancement (SE) methods (denoising) have brought only limited performance gains over state-of-the-art ASR back-end trained on multi-condition training data. Recently, there has been much research on neural network-based SE methods working in the time-domain showing levels of performance never attained before. However, it has not been established whether the high enhancement performance achieved by such time-domain approaches could be translated into ASR. In this paper, we show that a single-channel time-domain denoising approach can significantly improve ASR performance, providing more than 30 % relative word error reduction over a strong ASR back-end on the real evaluation data of the single-channel track of the CHiME-4 dataset. These positive results demonstrate that single-channel noise reduction can still improve ASR performance, which should open the door to more research in that direction.

연구 동기 및 목표

  • 최신 시대의 시간 도메인 음성 정제 기법이 잡음에 강건한 ASR 성능 향상에 기여하는지 조사하기 위해.
  • 엔드 투 엔드 ASR 시스템에서 전통적인 주파수 도메인 접근 방식과 시간 도메인 정제 네트워크를 비교하기 위해.
  • 단일 채널 음성 정제 및 ASR 성능에 대한 데이터 증강의 영향을 평가하기 위해.
  • 정제 시스템의 일반화 능력을 다양한 데이터셋과 잡음 조건 간에 평가하기 위해.

제안 방법

  • 단일 채널 잡음 제거를 위해 Conv-TasNet 아키텍처를 적응시켜, 노이즈가 섞인 웨이브폼에서 청소된 음성을 재구성하도록 훈련한다.
  • 두 가지 변종을 제안한다: 하나는 강화된 음성만 예측하고, 다른 하나는 다중 작업 훈련을 위해 음성과 잡음을 모두 예측한다.
  • 음성과 잡음 재구성의 조합을 통해 훈련을 정규화하고 일반화 능력을 향상시키기 위해 다중 작업 손실 함수를 사용한다.
  • 예측된 웨이브폼과 목표 웨이브폼 간의 평균 제곱오차 기반의 시간 도메인 손실 함수를 적용한다.
  • 강건성을 향상시키기 위해 10만 개의 노이즈가 섞인 발화 데이터로 구성된 대규모 증강 데이터셋을 사용해 정제 네트워크를 훈련한다.
  • 재학습 없이 사전 훈련된 ASR 백엔드와 훈련된 정제 프론트엔드를 통합하여 실제 노이즈가 섞인 데이터에서 ASR 성능을 평가한다.

실험 결과

연구 질문

  • RQ1시간 도메인 음성 정제 네트워크가 실제 노이즈가 섞인 녹음 데이터에서 ASR 성능을 크게 향상시킬 수 있는가?
  • RQ2ASR 백엔드를 미세조정하지 않은 상태에서 시간 도메인 정제로 인한 성능 향상이 ASR로 전이되는가?
  • RQ3데이터 증강이 단일 채널 정제 시스템의 일반화 능력과 ASR 성능에 어떤 영향을 미치는가?
  • RQ4제안된 정제 방법이 CHiME-4 데이터셋 이외의 다양한 잡음 조건과 ASR 백엔드에 일반화될 수 있는가?

주요 결과

  • Denoising-TasNet은 ASR 백엔드를 재학습하지 않은 상태에서도 실제 CHiME-4 테스트 데이터에서 기준 모델 대비 30% 이상의 상대적 WER 감소를 달성했다.
  • SDR 성능이 더 높은 FD-BLSTM 및 FD-Conv-FDL과는 달리, Denoising-TasNet은 SDR와 ASR 성능 양면에서 모두 우수한 성능을 보였다.
  • 훈련 발화 수를 35,000개에서 100,000개로 증가시킨 데이터 증강은 Denoising-TasNet과 FD-BLSTM 양쪽 모두의 ASR 성능 향상에 기여했으며, 특히 FD-BLSTM는 Enh-AM 설정에서 실제 CHiME-4 데이터에서 10.40%의 WER를 기록했다.
  • 정제 시스템은 Aurora-4 데이터셋으로도 잘 일반화되었으며, 노이즈가 섞인 테스트 세트에서 WER를 8.5%에서 6.3%로 감소시켰고, 청소된 세트에서는 최소한의 성능 저하를 보였다.
  • 음성과 잡음 출력을 별도로 예측하는 다중 작업 훈련은 일반화 능력을 향상시키고 단일 출력 훈련보다 더 우수한 ASR 성능을 이끌어냈다.
  • 결과적으로, 단일 채널 시간 도메인 정제 기법이 여전히 잡음에 강건한 ASR 향상에 유효하고 효과적인 방법임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.