Skip to main content
QUICK REVIEW

[논문 리뷰] Perceptual audio loss function for deep learning

D. Elbaz, Michael Zibulevsky|arXiv (Cornell University)|2017. 08. 20.
Speech and Audio Processing참고 문헌 3인용 수 4
한 줄 요약

이 논문은 Wavenet 아키텍처를 기반으로 한 미분 가능하고 학습 가능한 청각적 손실 함수를 제안하여 PESQ 음성 품질 측정값을 근사한다. 청결-손상된 오디오 쌍에 대해 Wavenet 모델을 훈련시켜 PESQ 점수를 예측함으로써, 인간의 주관적 품질 인식에 더 잘 맞는 엔드 투 엔드 음성 강화가 가능해지며, 0.25초 오디오 클립에서 전체 세그먼트 PESQ와 81%의 상관관계를 달성한다.

ABSTRACT

PESQ and POLQA , are standards are standards for automated assessment of voice quality of speech as experienced by human beings. The predictions of those objective measures should come as close as possible to subjective quality scores as obtained in subjective listening tests. Wavenet is a deep neural network originally developed as a deep generative model of raw audio wave-forms. Wavenet architecture is based on dilated causal convolutions, which exhibit very large receptive fields. In this short paper we suggest using the Wavenet architecture, in particular its large receptive filed in order to learn PESQ algorithm. By doing so we can use it as a differentiable loss function for speech enhancement.

연구 동기 및 목표

  • 주관적 음성 품질과 상관관계가 있는 미분 가능한 손실 함수를 개발하는 것, 특히 PESQ 측정값을 모방하는 것.
  • MSE 및 PSNR와 같은 표준 손실 함수의 한계를 해결하는 것, 이는 인간의 MOS 점수와 낮은 상관관계를 보이기 때문이다.
  • Wavenet의 확장된 인과 컨벌루션을 활용하여 음성 신호의 장기적 시간적 의존성을 모델링하는 것.
  • 청각적으로 정보가 풍부한, 미분 가능한 손실 함수를 사용하여 음성 강화 모델의 엔드 투 엔드 훈련을 가능하게 하는 것.
  • 최적화 과정에서 학습된 PESQ 손실과 MSE 손실을 조합하여 음성 강화의 정밀도를 향상시키는 것.

제안 방법

  • 완전한 參考 알고리즘에서 제공하는 진짜 PESQ 값으로 0.25초짜리 청결-손상된 오디오 쌍의 PESQ 점수를 예측하기 위해 Wavenet 모델을 훈련한다.
  • 청결 및 손상된 신호 모두에 대해 16 kHz 샘플링된 입력(4095개 샘플, 0.25초)을 사용한다.
  • 모델의 성능 향상과 다수의 화자에 대해 단일 모델을 사용할 수 있도록 화자 신원 정보를 조건으로 삼는다.
  • Wavenet의 확장된 인과 컨벌루션을 활용하여 8190개 샘플의 수신장(Receptive Field)을 확보함으로써 PESQ 유사 평가에 필수적인 장기적 의존성을 포착한다.
  • 훈련된 Wavenet을 음성 강화에서 사용 가능한 미분 가능한 손실 함수로 활용하며, 가중치 합을 통해 MSE 손실과 조합한다: $ P(x_{\text{clean}}, x_{\text{degraded}}) + \lambda \cdot \text{MSE}(x_{\text{clean}}, x_{\text{degraded}}) $.
  • TIMIT 코퍼스에서 모델을 훈련하며, 손상된 오디오를 무작위 단계 푸리에 변환을 통해 음성 형태의 노이즈로 생성한다.

실험 결과

연구 질문

  • RQ1큰 수신장을 가진 딥 네트워크가 PESQ 음성 품질 측정값을 미분 가능한 방식으로 근사할 수 있는가?
  • RQ20.25초 짜리 짧은 오디오 세그먼트에서 훈련된 Wavenet 기반 모델이 전체 세그먼트 PESQ 점수와 얼마나 잘 상관되는가?
  • RQ3학습된 청각적 손실이 표준 MSE 또는 PSNR 손실 대비 음성 강화 품질을 얼마나 향상시킬 수 있는가?
  • RQ4화자 신원에 조건을 주는 것이 학습된 PESQ 예측기의 정확성과 일반화 능력을 향상시키는 데 기여하는가?
  • RQ5딥 러닝 모델을 사용하여 엔드 투 엔드 훈련 파이프라인에서 비미분 가능한 PESQ 알고리즘을 대체하거나 모방하는 것이 가능한가?

주요 결과

  • Wavenet 기반 모델은 0.25초 오디오 클립에서 전체 세그먼트 PESQ 점수와 81%의 상관관계를 달성하였다.
  • 큰 수신장(8190개 샘플)을 통해 장기적 시간적 의존성을 포착함으로써 모델이 PESQ 점수를 성공적으로 예측하였다.
  • 화자 신원에 조건을 주는 것이 TIMIT 데이터셋 내 다양한 화자 간의 일반화 능력을 향상시키는 데 기여하였다.
  • 학습된 PESQ 손실 함수는 미분 가능하며 엔드 투 엔드 음성 강화 모델의 훈련에 통합될 수 있다.
  • 학습된 청각적 손실과 MSE 손실의 조합은 MSE만 사용할 경우보다 주관적 품질 인식에 더 잘 부합하는 최적화를 가능하게 하였다.
  • 이 방법은 딥 러닝이 복잡한 비미분 가능한 목적 품질 측정값(예: PESQ)을 훈련 가능한 형태로 효과적으로 근사할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.