Skip to main content
QUICK REVIEW

[논문 리뷰] ESPnet-se: end-to-end speech enhancement and separation toolkit designed for asr integration

Chenda Li, Jing Shi|arXiv (Cornell University)|2020. 11. 07.
Speech and Audio Processing참고 문헌 60인용 수 75
한 줄 요약

ESPnet-SE는 자동 음성 인식(ASR)과의 원활한 통합을 위해 설계된 엔드 투 엔드 음성 향상 및 분리 툴킷으로, 음성 향상 시스템과 ASR 모델의 공동 학습 및 평가를 가능하게 합니다. 단일 및 다중 채널, 반향이 없는 및 반향이 있는, 단일 및 다중 화자 시나리오를 지원하며, 최신 성능을 기록합니다. 특히 WSJ0-2mix에서 분리 및 ASR의 공동 최적화로 16.1% WER를 달성했습니다.

ABSTRACT

We present ESPnet-SE, which is designed for the quick development of speech enhancement and speech separation systems in a single framework, along with the optional downstream speech recognition module. ESPnet-SE is a new project which integrates rich automatic speech recognition related models, resources and systems to support and validate the proposed front-end implementation (i.e. speech enhancement and separation).It is capable of processing both single-channel and multi-channel data, with various functionalities including dereverberation, denoising and source separation. We provide all-in-one recipes including data pre-processing, feature extraction, training and evaluation pipelines for a wide range of benchmark datasets. This paper describes the design of the toolkit, several important functionalities, especially the speech recognition integration, which differentiates ESPnet-SE from other open source toolkits, and experimental results with major benchmark datasets.

연구 동기 및 목표

  • 엔드 투 엔드 음성 향상 및 분리(E2E-SE)를 자동 음성 인식(ASR)과 통합한 통합형 오픈소스 툴킷을 개발하여 공동 최적화를 가능하게 하는 것.
  • 청취 가능한 참조 음성 신호가 없는 상황에서 전사 데이터를 활용해 ASR 손실을 사용하여 E2E-SE 모델의 원활한 학습 및 평가를 가능하게 하는 것.
  • 단일/다중 채널, 반향이 없는/반향이 있는, 단일/다중 화자 시나리오를 포함한 다양한 입력 조건을 하나의 프레임워크 내에서 지원하는 것.
  • 기준 데이터셋에서 데이터 준비, 특징 추출, 학습, 평가를 위한 즉시 사용 가능한, 통합형 레시피를 제공하는 것.
  • ESPnet의 풍부한 ASR 모델과 직접 통합하여 공동 최적화 및 성능 평가가 가능한 방식으로 기존 툴킷과 차별화하는 것.

제안 방법

  • 최신 기술의 E2E-SE 모델(TasNet, DPRNN, T-F masking, 신경 기반 빔포머)을 통합된 파이토치 기반 프레임워크에 통합하는 것.
  • 원시 웨이브포맷 입력을 지원하고 주파수 도메인 모델에 대해 미분 가능한 STFT를 적용하여 backpropagation을 통한 엔드 투 엔드 학습을 가능하게 하는 것.
  • 다양한 기준 데이터셋에서 데이터 전처리, 특징 추출, 모델 학습, 평가를 위한 통합된 단계별 레시피를 제공하는 것.
  • ESPnet의 ASR 모델(예: Transformer, CTC, attention 기반 인코더-디코더)과의 선택적 통합을 통해 ASR 손실을 사용한 공동 학습을 가능하게 하는 것.
  • E2E-SE 손실과 ASR 손실을 모두 사용한 공동 최적화를 지원하여, 청취 가능한 참조가 없는 약한 지도 학습 데이터(예: CHiME-4)에서도 직접 학습이 가능한 것.
  • 사전 학습된 ASR 모델(예: WSJ에서 학습된 모델)을 사용해 향상/분리된 음성의 성능을 평가하여, WER/CER를 통한 E2E-SE 성능의 제로샷 평가를 가능하게 하는 것.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 음성 향상 및 분리 모델이 통합된 프레임워크 내에서 자동 음성 인식(ASR)과 효과적으로 통합되어 내성적 성능을 향상시킬 수 있는가?
  • RQ2E2E-SE 및 ASR 모듈의 공동 최적화가 노이즈가 많거나 반향이 있는 음성에서의 인식 성능에 어떤 영향을 미치는가?
  • RQ3ASR 메트릭을 사용해 평가했을 때, WSJ0-2mix 및 스페이셜라이즈드 WSJ0-2mix와 같은 기준 데이터셋에서 E2E-SE 모델의 성능은 어떠한가?
  • RQ4청취 가능한 참조 음성 신호가 없는 상황에서 전사 데이터만을 활용해 E2E-SE 시스템이 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ5ASR를 E2E-SE 파이프라인에 통합하는 방식이 독립적인 E2E-SE 또는 독립적인 ASR와 비교해 복원력 및 일반화 능력 측면에서 어떻게 다른가?

주요 결과

  • Conv-TasNet을 ASR 모델과 통합한 결과, WSJ0-2mix 평가 세트에서 16.7% WER를 달성하여 강력한 엔드 투 엔드 성능를 입증함.
  • DPRNN 기반 E2E-SE 모델은 ASR와 공동 최적화된 결과, WSJ0-2mix에서 16.1% WER를 기록하며, 일부 경우에서 독립적인 ASR 모델보다 뛰어난 성능을 보임.
  • 스페이셜라이즈드 WSJ0-2mix 데이터셋에서 신경 기반 빔포머 모델은 이전 연구 대비 반향이 없는 조건에서 7 dB 이상의 SDR 향상을 기록함.
  • 반향 조건에서는 이전 연구와 유사한 성능를 기록하였으며, WPE 역반향 제거 모듈과 결합할 경우 추가적인 성능 향상을 얻음.
  • E2E-SE와 ASR의 공동 학습은 단지 WSJ0-2mix 데이터셋에서만 학습된 경우에도 ASR 성능 향상을 이끌어내며(예: Conv-TasNet + Transformer로 15.8% WER), 성능 향상을 확인함.
  • spectrogram 시각화 결과 DPRNN 모델이 도전적인 동성별 혼합 신호에서 소스 신호를 효과적으로 분리함을 확인하였으며, 두 테스트 샘플에서 각각 18.54 dB 및 12.88 dB의 높은 SDR를 기록함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.