Skip to main content
QUICK REVIEW

[논문 리뷰] Two Heads Are Better Than One: A Two-Stage Approach for Monaural Noise Reduction in the Complex Domain

Andong Li, Chengshi Zheng|arXiv (Cornell University)|2020. 11. 03.
Speech and Audio Processing참고 문헌 26인용 수 10
한 줄 요약

이 논문은 단일 귀 노이즈 감소 성능을 햖थ기 위해 크기와 위상을 분리하여 추정하는 두 단계 복소수 도메인 음성 강화 네트워크(CTS-Net)를 제안한다. 첫 번째 단계에서는 수정된 게이팅 타임스탬프 컨볼루션 모듈(MG-TCM)을 사용해 거친 크기 추정치를 생성하고, 이를 노이즈가 있는 위상과 조합하여 거친 복소 스펙트럼을 형성한다. 두 번째 단계에서는 실수부와 허수부를 모두 개선하기 위해 잔차를 학습하는 네트워크를 적용하여, 특히 저 SNR 조건에서 PESQ, ESTOI, SDR 성능을 기존 방법보다 크게 향상시킨다.

ABSTRACT

In low signal-to-noise ratio conditions, it is difficult to effectively recover the magnitude and phase information simultaneously. To address this problem, this paper proposes a two-stage algorithm to decouple the joint optimization problem w.r.t. magnitude and phase into two sub-tasks. In the first stage, only magnitude is optimized, which incorporates noisy phase to obtain a coarse complex clean speech spectrum estimation. In the second stage, both the magnitude and phase components are refined. The experiments are conducted on the WSJ0-SI84 corpus, and the results show that the proposed approach significantly outperforms previous baselines in terms of PESQ, ESTOI, and SDR.

연구 동기 및 목표

  • 저 SNR 조건에서의 단일 귀 음성 강화에서 크기와 위상 추정을 동시에 수행하는 과제를 해결한다.
  • 크기와 위상의 복잡한 최적화 문제를 두 개의 순차적이고 관리하기 쉬운 하위 문제로 분리한다.
  • 두 번째 단계에서 스펙트럼 크기와 위상을 모두 개선함으로써 청취자 친화성과 말의 명료성을 향상시킨다.
  • 수정된 게이팅 타임스탬프 컨볼루션 모듈(MG-TCM)을 통해 파라미터 중복을 줄이고 시계열 모델링 능력을 향상시킨다.
  • 시간-주파수 도메인 내 기존 딥러닝 기반 음성 강화 방법들과 비교해 일관된 성능 향상을 입증한다.

제안 방법

  • 두 단계 아키텍처를 사용한다: 첫 번째 단계는 정제된 크기만 추정하는 CME-Net, 두 번째 단계는 전체 복소 스펙트럼을 개선하는 CSR-Net이다.
  • 첫 번째 단계에서 추정된 크기를 노이즈가 있는 위상과 조합하여 거친 복소 스펙트럼 추정치를 형성한다.
  • 두 번째 단계에서 CSR-Net은 거친 추정치와 정제된 복소 스펙트럼 사이의 잔차를 학습하여 실수부와 허수부를 동시에 최적화한다.
  • 표준 TCM과 비교해 파라미터 중복을 줄이고 장거리 시계열 모델링 능력을 향상시킨 수정된 게이팅 타임스탬프 컨볼루션 모듈(MG-TCM)을 도입한다.
  • 감지 범위를 늘리되 파라미터 수를 증가시키지 않는 확장된 인과 컨볼루션(SD-conv)을 사용해 맥락 모델링 능력을 향상시킨다.
  • 실수부/허수부에 대한 L1 손실과 크기 손실을 조합하여 엔드 투 엔드 최적화를 수행한다.

실험 결과

연구 질문

  • RQ1두 단계로 나누어 크기와 위상 추정을 분리하면 저 SNR 조건에서의 단일 귀 음성 강화 성능 향상에 기여하는가?
  • RQ2먼저 크기를 추정하고 나서 복소 스펙트럼을 개선하는 두 단계 접근 방식이, 동시에 최적화하는 방식보다 청취자 친화성과 명료성 측면에서 더 우수한가?
  • RQ3수정된 게이팅 타임스탬프 컨볼루션 모듈(MG-TCM)이 파라미터 중복을 줄이고 시계열 모델링 능력을 향상시키며 표준 TCM을 능가하는가?
  • RQ4두 번째 단계에서 복소 스펙트럼에 대한 잔차 학습이 PESQ, ESTOI, SDR 지표에 상당한 향상을 이끌어내는가?
  • RQ5제안된 두 단계 방법은 최신 기술 기반의 베이스라인과 비교해 목적 지표와 모델 효율성 측면에서 어떻게 성능을 냅니다?

주요 결과

  • 제안된 CTS-Net은 WSJ0-SI84 테스트 세트에서 PESQ 2.71, ESTOI 72.27%, SDR 10.24 dB를 기록하여 모든 베이스라인을 뛰어넘는다.
  • 첫 번째 단계에서 MG-TCM 버전은 원본 TCM 대비 PESQ 0.04 향상, ESTOI 0.50% 향상하여 파라미터 중복 감소와 더 나은 성능을 입증한다.
  • 두 번째 단계에서 MG-TCM를 이중 분기 버전(DMG-TCM)으로 교체하면 PESQ 0.01 향상, ESTOI 0.38% 향상되며, 더 뛰어난 모델링 능력을 확인한다.
  • 확장된 인과 컨볼루션(SD-conv)을 사용하면 표준 확장 컨볼루션 대비 PESQ 0.03 향상, ESTOI 0.52% 향상, SDR 0.13 dB 향상된다.
  • CME-Net 단독 대비 CTS-Net은 PESQ 0.25 향상, ESTOI 6.94% 향상되며, 두 번째 개선 단계의 필요성을 입증한다.
  • GCRN 대비 CTS-Net은 PESQ 0.18 높고, ESTOI 4.29% 높고, SDR 1.38 dB 높아, 모든 지표에서 일관된 우수성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.