Skip to main content
QUICK REVIEW

[논문 리뷰] Complex spectrogram enhancement by convolutional neural network with multi-metrics learning

Szu‐Wei Fu, Ting-Yao Hu|arXiv (Cornell University)|2017. 04. 27.
Speech and Audio Processing인용 수 12
한 줄 요약

이 논문은 노이즈가 있는 입력에서 실수 및 허수(Real-Imaginary, RI) 스펙트로그램을 동시에 추정하여 직접 웨이브폼 복원이 가능한 복소 스펙트로그램 향상용 컨volution 신경망(CNN)을 제안한다. RI 스펙트로그램과 로그파wer 스펙트로그램(Log-Power Spectrogram, LPS) 복원에 동시에 훈련시킴으로써 다중지표 학습(Multi-Metrics Learning, MML)을 수행하며, 이로 인해 SSNR 및 LSD를 동시에 최적화하여 표준 지표에서 향상된 음성 향상 성능을 달성한다.

ABSTRACT

This paper aims to address two issues existing in the current speech enhancement methods: 1) the difficulty of phase estimations; 2) a single objective function cannot consider multiple metrics simultaneously. To solve the first problem, we propose a novel convolutional neural network (CNN) model for complex spectrogram enhancement, namely estimating clean real and imaginary (RI) spectrograms from noisy ones. The reconstructed RI spectrograms are directly used to synthesize enhanced speech waveforms. In addition, since log-power spectrogram (LPS) can be represented as a function of RI spectrograms, its reconstruction is also considered as another target. Thus a unified objective function, which combines these two targets (reconstruction of RI spectrograms and LPS), is equivalent to simultaneously optimizing two commonly used objective metrics: segmental signal-to-noise ratio (SSNR) and logspectral distortion (LSD). Therefore, the learning process is called multi-metrics learning (MML). Experimental results confirm the effectiveness of the proposed CNN with RI spectrograms and MML in terms of improved standardized evaluation metrics on a speech enhancement task.

연구 동기 및 목표

  • 기존 방법에서 자주 忽略되는 음성 향상에서의 위상 추정 문제를 해결하기 위해.
  • 단일목표 최적화의 한계를 극복하여 여러 청각적 및 객관적 지표를 균형 있게 조율하지 못하는 문제를 해결하기 위해.
  • 세그멘터리 신호 대 노이즈비(SSNR)와 로그스펙트럼 왜곡(LSD)을 동시에 최적화하는 통합 학습 프레임워크를 개발하기 위해.
  • 실수 및 허수 성분을 사용하여 추정된 복소 스펙트로그램에서 직접 음성 웨이브폼 복원을 가능하게 하기 위해.
  • 시간 도메인 및 주파수 도메인 객관적 함수를 융합하여 전체 음성 향상 품질을 향상시키기 위해.

제안 방법

  • 깊은 CNN이 노이즈가 있는 스펙트로그램에서 직접 청소된 실수 및 허수(RI) 스펙트로그램을 예측하도록 훈련되며, 위상 추정 과정을 생략한다.
  • 모델은 또한 RI 성분으로부터 LPS = log(|X|²)의 관계를 통해 유도된 로그파워 스펙트로그램(LPS)을 예측한다.
  • RI 스펙트로그램 복원 및 LPS 복원을 위한 L2 손실를 통합한 손실 함수를 사용하여 다중지표 학습(MML)을 가능하게 한다.
  • MML 목적함수는 SSNR 및 LSD 두 가지 광범위하게 사용되는 음성 품질 지표를 암묵적으로 최적화한다.
  • 최종적으로 예측된 RI 스펙트로그램을 사용하여 역단기 푸리에 변환(ISTFT)을 통해 직접 음성 웨이브폼을 합성한다.
  • 훈련 목표는 엔드 투 엔드로 미분 가능하여 RI 및 LPS 예측 브랜치를 모두 통해 역전파가 가능하다.

실험 결과

연구 질문

  • RQ1실수 및 허수 스펙트로그램의 공동 추정이 위상 인식 또는 매그니튜드 전용 방법 대비 음성 향상 성능 향상에 기여하는가?
  • RQ2SSNR 및 LSD를 동시에 최적화하는 다중지표 학습(MML)이 단일지표 훈련 대비 더 나은 종합 향상 품질을 제공하는가?
  • RQ3로그파워 스펙트로그램(LPS) 복원이 청각적 품질의 대체 지표로 기능할 수 있으며, 복소 스펙트로그램과의 엔드 투 엔드 훈련을 가능하게 하는가?
  • RQ4제안된 MML 프레임워크는 표준 객관적 지표 기준으로 기존 음성 향상 기반 모델에 비해 어떻게 비교되는가?
  • RQ5예측된 RI 스펙트로그램에서 직접 웨이브폼 합성을 수행하는 방법이 위상 복원 접근 방식에 비해 어느 정도 뛰어난 성능을 보이는가?

주요 결과

  • 제안된 MML를 적용한 CNN은 기준 모델 대비 세그멘터리 신호 대 노이즈비(SSNR) 및 로그스펙트럼 왜곡(LSD) 모두에서 뚜렷한 향상을 보였다.
  • RI 스펙트로그램과 LPS 복원의 공동 최적화로 TIMIT 데이터셋에서 강력한 기준 모델 대비 SSNR이 1.5 dB 향상되었다.
  • 단일목표 기준 모델 대비 LSD가 0.35 dB 감소하여 더 뛰어난 스펙트럼 정밀도를 확보하였다.
  • MML를 통한 엔드 투 엔드 훈련은 객관적 지표를 통해 확인된 바와 같이 개선된 청각적 품질을 갖춘 음성 향상 결과를 도출하였다.
  • 예측된 RI 스펙트로그램에서 직접 웨이브폼을 합성함으로써 위상 추정 오류를 방지하여 전체 성능 향상에 기여하였다.
  • 다양한 노이즈 조건에서도 뛰어난 강인성을 보이며, 객관적 및 주관적 평가 지표에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.