Skip to main content
QUICK REVIEW

[논문 리뷰] Explicit Estimation of Magnitude and Phase Spectra in Parallel for High-Quality Speech Enhancement

Ye-Xin Lu, Yang Ai|arXiv (Cornell University)|2023. 08. 17.
Speech and Audio Processing인용 수 5
한 줄 요약

이 논문은 시간-주파수 트랜스포머를 갖춘 코덱 아키텍처를 사용하여 병렬로 크기 스펙트럼과 위상 스펙트럼을 명시적으로 추정하는 새로운 음성 향상 네트워크인 MP-SENet을 제안한다. 크기와 위상 추정을 분리하고, 반복 방지 손실 및 인지적 손실을 적용하여, 음성 노이즈 제거 작업에서 VoiceBank+DEMAND 데이터셋에서 PESQ 3.60의 최고 성능을 달성하였으며, 조화 성분 복원 능력이 뛰어나고 이중 방향 보정 효과가 감소하였다.

ABSTRACT

Phase information has a significant impact on speech perceptual quality and intelligibility. However, existing speech enhancement methods encounter limitations in explicit phase estimation due to the non-structural nature and wrapping characteristics of the phase, leading to a bottleneck in enhanced speech quality. To overcome the above issue, in this paper, we proposed MP-SENet, a novel Speech Enhancement Network that explicitly enhances Magnitude and Phase spectra in parallel. The proposed MP-SENet comprises a Transformer-embedded encoder-decoder architecture. The encoder aims to encode the input distorted magnitude and phase spectra into time-frequency representations, which are further fed into time-frequency Transformers for alternatively capturing time and frequency dependencies. The decoder comprises a magnitude mask decoder and a phase decoder, directly enhancing magnitude and wrapped phase spectra by incorporating a magnitude masking architecture and a phase parallel estimation architecture, respectively. Multi-level loss functions explicitly defined on the magnitude spectra, wrapped phase spectra, and short-time complex spectra are adopted to jointly train the MP-SENet model. A metric discriminator is further employed to compensate for the incomplete correlation between these losses and human auditory perception. Experimental results demonstrate that our proposed MP-SENet achieves state-of-the-art performance across multiple speech enhancement tasks, including speech denoising, dereverberation, and bandwidth extension. Compared to existing phase-aware speech enhancement methods, it further mitigates the compensation effect between the magnitude and phase by explicit phase estimation, elevating the perceptual quality of enhanced speech.

연구 동기 및 목표

  • 암묵적이고 정확도가 떨어지는 위상 추정으로 인해 지속적으로 발생하는 음성 향상 품질 저하 문제를 해결하기 위해.
  • 크기와 위상 간의 이중 방향 보정 효과로 인해 조화 성분 구조와 인지적 품질이 떨어지는 문제를 극복하기 위해.
  • 크기 및 위상 스펙트럼을 병렬로 명시적으로 모델링하고 최적화하여 음성의 자연스러움과 이해도를 향상시키기 위해.
  • 노이즈 제거, 반향 제거, 대역폭 확장 등 다양한 작업에서 고품질 향상을 수행하는 통합 프레임워크를 개발하기 위해.
  • 절삭 실험과 정량적 지표를 통해 명시적 위상 추정의 효과를 검증하기 위해.

제안 방법

  • MP-SENet은 왜곡된 크기 스펙트럼과 래핑된 위상 스펙트럼을 시간-주파수 표현으로 처리하는 인코더를 갖춘 코덱 아키텍처를 사용한다.
  • 디코더는 이중 스트림 브랜치를 사용한다: 하나는 명시적인 크기 스펙트럼 추정을 위한 것이고, 다른 하나는 병렬 위상 추정 아키텍처를 사용한 명시적인 위상 스펙트럼 추정을 위한 것이다.
  • 시간-주파수 트랜스포머는 인코더와 디코더를 연결하여 시간 및 주파수 차원에서 장거리 의존성을 포착한다.
  • 모델은 다수 수준의 손실 함수로 훈련되며, 크기 스펙트럼에는 평균 제곱오차와 인지적 손실을, 위상 스펙트럼에는 반복 방지 손실을, 단기 복소 스펙트럼에는 평균 제곱오차와 일致성 손실을 적용한다.
  • 인지적 품질 향상을 위해 인간 중심의 지표를 최적화하기 위해 적대적 메트릭 디스크림네이터를 사용한다.
  • 위상 스펙트럼은 위상의 주기성과 불연속성을 방지하기 위해 반복 방지 손실을 사용하여 명시적으로 최적화된다.

실험 결과

연구 질문

  • RQ1크기 및 위상 스펙트럼의 명시적 병렬 추정이 음성 향상에서 암묵적 또는 순차적 위상 모델링보다 우월한가?
  • RQ2명시적 위상 추정이 크기와 위상 간의 이중 방향 보정 효과를 감소시켜 조화 성분의 보존에 기여하는가?
  • RQ3반복 방지 손실과 인지적 손실은 어떻게 음성 품질과 인지적 지표 향상에 기여하는가?
  • RQ4시간 및 주파수 트랜스포머의 순차적 대비 병렬 스택 구조와 같은 아키텍처 선택이 성능에 미치는 영향은 무엇인가?
  • RQ5명시적 위상 모델링은 컴act한 모델로 다수의 음성 향상 작업에서 SOTA 성능을 달성할 수 있는가?

주요 결과

  • MP-SENet은 음성 노이즈 제거 작업에서 공개된 VoiceBank+DEMAND 데이터셋에서 기존의 위상 인식 방법들을 능가하는 SOTA PESQ 3.60을 달성하였다.
  • 스펙트로그램 비교를 통해 시각적으로 확인된 바와 같이, 모델은 조화 성분 복원 능력이 뛰어나다.
  • 절삭 실험 결과, 명시적 위상 추정이 필수적임을 입증하였으며, 위상 디코더를 제거할 경우 성능 저하가 심각하게 발생하였다.
  • 반복 방지 손실과 인지적 메트릭 손실은 고품질의 인지적 품질을 확보하는 데 핵심적인 역할을 하며, 특히 MOS 기반 지표 향상에 뚜렷한 기여를 하였다.
  • 트랜스포머를 컨フォ머로 교체하면 성능 저하가 약간 발생하지만, 모델 크기가 더 작음(1.77M 파라미터)에도 불구하고 CMGAN를 능가하였다.
  • 시간 및 주파수 트랜스포머의 순차적 스택이 병렬 스택보다 略적으로 더 효과적이지만, 둘 다 뛰어난 성능을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.