Skip to main content
QUICK REVIEW

[논문 리뷰] Speech denoising by parametric resynthesis

Soumi Maiti, Michael Mandel|arXiv (Cornell University)|2019. 04. 02.
Speech and Audio Processing참고 문헌 18인용 수 4
한 줄 요약

이 논문은 신경망을 사용하여 노이즈가 있는 입력에서 청소된 음성의 보코더 파rameter를 예측하고, 보코더를 통해 고품질의 노이즈가 제거된 음성을 재생성하는 파rametric 재생성 접근법을 제안한다. 이 방법은 오라클 위너 마스크와 동등한 주관적 품질과 이해도를 달성하며, DNN 기반 마스크 예측을 뛰어넘으며, 텍스트 기반 합성과 비교해 노이즈가 있는 음성에서의 프로소디 정보가 더 우수한 음성 품질을 가능하게 한다.

ABSTRACT

This work proposes the use of clean speech vocoder parameters as the target for a neural network performing speech enhancement. These parameters have been designed for text-to-speech synthesis so that they both produce high-quality resyntheses and also are straightforward to model with neural networks, but have not been utilized in speech enhancement until now. In comparison to a matched text-to-speech system that is given the ground truth transcripts of the noisy speech, our model is able to produce more natural speech because it has access to the true prosody in the noisy speech. In comparison to two denoising systems, the oracle Wiener mask and a DNN-based mask predictor, our model equals the oracle Wiener mask in subjective quality and intelligibility and surpasses the realistic system. A vocoder-based upper bound shows that there is still room for improvement with this approach beyond the oracle Wiener mask. We test speaker-dependence with two speakers and show that a single model can be used for multiple speakers.

연구 동기 및 목표

  • 노이즈가 있는 음성에 포함된 프로소디 정보를 활용하여 음성 노이즈 제거를 향상시키고, 이는 텍스트 기반 TTS 시스템에서 손실되는 정보이다.
  • 기존 음성 강화 기법의 한계, 즉 음성의 과도한 억압과 노이즈의 부족한 억압을 해결한다.
  • 고품질의 음성 합성을 위해 설계된 청소된 음성 보코더 파rameter가 신경망 기반 노이즈 제거의 효과적인 목표로 사용될 수 있는지 탐색한다.
  • 제안된 방법의 성능을 기존 기준선, 특히 오라클 위너 마스크와 DNN 기반 마스크 예측과 비교 평가한다.
  • 단일 학습된 시스템을 통해 여러 화자에 대해 화자 독립성과 일반화 능력을 탐구한다.

제안 방법

  • 노이즈가 있는 로그 멜 스펙트로그램 특징에서 청소된 음성의 음향 파ram터(스펙트럼 엔벨롭, F0, 음성/비음성, 비주기적 에너지)를 예측하기 위해 신경망을 학습한다.
  • WORLD 보코더를 사용해 청소된 음성을 음향 파ram터로 인코딩하고, 예측된 파ram터를 다시 웨이브폼으로 디코딩하여 고해상도 재생성을 가능하게 한다.
  • 예측된 파ram터와 진짜 파ram터 간의 평균 제곱오차 손실을 사용해 예측 모델을 학습하며, 이는 첫 번째 및 두 번째 도함수를 포함한 특징을 포함한다.
  • 시간적 맥락을 모델링하기 위해 피드포워드 DNN 및 LSTM 아키텍처를 모두 구현하였으며, LSTM 버전이 더 우수한 성능을 보였다.
  • 노이즈가 있는 음성에 모델을 적용하여 청소된 파ram터를 예측하고 신호를 재생성함으로써 노이즈가 제거된 출력을 생성한다.
  • 보코더 기반 상한선을 사용해 방법의 잠재적 최고 성능을 평가하였으며, 오라클 위너 마스크를 뛰어넘는 향상 여정이 여전히 가능함을 보여주었다.

실험 결과

연구 질문

  • RQ1청소된 음성 보코더 파ram터가 신경망 기반 음성 노이즈 제거에 효과적인 목표로 사용될 수 있는가?
  • RQ2노이즈가 있는 음성에서의 프로소디를 활용할 경우, 텍스트 기반 TTS 시스템과 비교해 음성 품질이 향상되는가?
  • RQ3주관적 품질과 이해도 측면에서 파라미터 기반 재생성의 성능은 오라클 위너 마스크 및 DNN 기반 마스크 예측과 어떻게 비교되는가?
  • RQ4화자별 적응 없이 단일 모델이 여러 화자에 대해 일반화 가능한가?
  • RQ5이 파라미터 기반 재생성 접근법의 성능 상한선은 무엇이며, 기존 방법과 비교해 어떻게 되는가?

주요 결과

  • 파라미터 기반 재생성 모델은 청소된 신호에 접근 가능한 오라클 위너 마스크와 동등한 주관적 음성 품질과 이해도를 달성한다.
  • 모델은 주관적 품질과 이해도 모두에서 DNN 기반 마스크 예측기보다 뛰어나며, PESQ 점수는 2.43 대 2.26, STOI는 0.87 대 0.80를 기록한다.
  • 주관적 MUSHRA 테스트를 통해 모델은 노이즈가 제거된 음성을 생성함을 확인하였으며, 오라클 위너 마스크보다 뛰어난 노이즈 억압 품질을 달성하였다.
  • 모델은 객관적 지표와 주관적 품질 모두에서 표준 통계적 TTS 시스템을 뛰어넘었으며, PESQ는 2.43 대 1.33, STOI는 0.87 대 0.08를 기록하였다.
  • 다양한 화자에 대해 학습한 단일 모델이 화자 간에 높은 성능을 유지하며, 효과적인 화자 독립성을 보였다.
  • 보코더 기반 상한선은 오라클 위너 마스크를 뛰어넘는 향상 여정이 여전히 존재함을 보여주었으며, 향후 최적화 가능성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.