Skip to main content
QUICK REVIEW

[논문 리뷰] Boosting Objective Scores of a Speech Enhancement Model by MetricGAN Post-processing

Szu‐Wei Fu, Chien-Feng Liao|arXiv (Cornell University)|2020. 06. 18.
Speech and Audio Processing참고 문헌 23인용 수 10
한 줄 요약

이 논문은 Transformer 기반 음성 정화 모델의 객관적 음성 품질 점수, 특히 PESQ를 향상시키는 MetricGAN 기반 후처리 프레임워크를 제안한다. 사전 훈련된 L1 Transformer를 MetricGAN로 미세조정함으로써 주 모델을 재학습하지 않고도 청취 품질을 향상시킬 수 있으며, 벤치마크 데이터셋에서 DNS 챌린지 기준선 대비 뚜렷한 성능 향상을 달성한다.

ABSTRACT

The Transformer architecture has demonstrated a superior ability compared to recurrent neural networks in many different natural language processing applications. Therefore, our study applies a modified Transformer in a speech enhancement task. Specifically, positional encoding in the Transformer may not be necessary for speech enhancement, and hence, it is replaced by convolutional layers. To further improve the perceptual evaluation of the speech quality (PESQ) scores of enhanced speech, the L_1 pre-trained Transformer is fine-tuned using a MetricGAN framework. The proposed MetricGAN can be treated as a general post-processing module to further boost the objective scores of interest. The experiments were conducted using the data sets provided by the organizer of the Deep Noise Suppression (DNS) challenge. Experimental results demonstrated that the proposed system outperformed the challenge baseline, in both subjective and objective evaluations, with a large margin.

연구 동기 및 목표

  • 주 모델 아키텍처를 재학습하지 않고도 음성 정화 모델의 객관적 음성 품질 점수, 특히 PESQ를 향상시키는 것.
  • 음성 정화 시스템에서 객관적 지표와 청취 품질 간 격차를 해소하는 것.
  • 객관적 지표 기반 적대적 훈련을 사용하여 어떤 모델 출력도 향상시킬 수 있는 일반적인 후처리 모듈을 개발하는 것.
  • 음성 시퀀스에 더 적합한 수정된 위치 인코딩을 사용하여 음성 정화에 Transformer 아키텍처를 활용하는 것.
  • Deep Noise Suppression (DNS) 챌린지 데이터셋에서 제안된 방법의 유효성을 검증하는 것.

제안 방법

  • 음성 신호 표현에 더 적합하도록 Transformer의 표준 위치 인코딩을 컬러블레이션 레이어로 대체하는 것.
  • MetricGAN 프레임워크를 사용해 사전 훈련된 L1 Transformer 모델을 미세조정하여 객관적 점수를 향상시키는 것.
  • PESQ와 같은 객관적 지표를 기반으로 보정된 음성과 참값의 청결한 음성을 구분할 수 있도록 판별기(Discriminator)를 훈련하는 것.
  • 적대적 훈련을 통해 생성기(음성 정화기)가 객관적 지표에서 높은 점수를 받는 출력을 생성하도록 최적화하는 것.
  • 훈련된 MetricGAN을 후처리 모듈로 적용하여 사전 훈련된 음성 정화 모델의 출력을 향상시키는 것.
  • 주관적 및 객관적 지표를 모두 사용하여 DNS 챌린지 데이터셋에서 방법을 평가하는 것.

실험 결과

연구 질문

  • RQ1사전 훈련된 음성 정화 모델의 객관적 음성 품질 점수를 뚜렷이 향상시킬 수 있는 후처리 MetricGAN 프레임워크는 가능한가?
  • RQ2표준 위치 인코딩을 컬러블레이션 레이어로 대체할 경우, Transformer의 음성 정화 성능에 어떤 영향을 미치는가?
  • RQ3PESQ와 같은 객관적 지표 기반 적대적 훈련이 주 모델을 재학습하지 않고도 청취 품질을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 MetricGAN 후처리 모듈은 다양한 음성 정화 모델에 일반화 가능한가?
  • RQ5주관적 평가와 객관적 평가 양 측면에서 이 방법은 DNS 챌린지 기준선을 초월하는가?

주요 결과

  • 제안된 MetricGAN 후처리 방법은 DNS 챌린지 기준선 대비 PESQ 점수를 뚜렷이 향상시켰다.
  • 객관적 및 주관적 평가에서 모두 큰 격차를 확보하여 뛰어난 음성 품질을 입증했다.
  • 표준 위치 인코딩을 컬러블레이션 레이어로 대체함으로써 음성 정화 작업에서 모델 성능이 향상되었다.
  • L1 Transformer를 MetricGAN로 미세조정함으로써 주 모델을 재학습하지 않고도 객관적 지표에서 측정 가능한 성능 향상을 달성했다.
  • MetricGAN 후처리 모듈은 일반화 가능하며, 어떤 사전 훈련된 음성 정화 모델에도 적용하여 객관적 점수를 향상시킬 수 있다.
  • 모든 평가 지표에서 기준선을 초월하여 제안된 프레임워크의 유효성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.