Skip to main content
QUICK REVIEW

[논문 리뷰] ICASSP 2021 Deep Noise Suppression Challenge: Decoupling Magnitude and Phase Optimization with a Two-Stage Deep Network

Andong Li, Wenzhe Liu|arXiv (Cornell University)|2021. 02. 08.
Speech and Audio Processing참고 문헌 32인용 수 8
한 줄 요약

이 논문은 실시간 음성 향상에 적합한 두 단계의 딥 네트워크인 TSCN-PP를 제안하며, 크기와 위상 최적화를 분리한다: 먼저 크기 성분을 근사적으로 추정한 후, 두 번째 단계에서 크기와 위상을 동시에 보정하고, 잔여 노이즈를 억제하기 위한 경량 후처리 모듈을 추가한다. 이 방법은 ICASSP 2021 DNS 챌린지 실시간 트랙에서 3.38점의 MOS 점수(ITU-T P.808 기준)를 기록하여 주관적 품질 향상이 두드러지게 되었으며, 객관적 지표는 약간 떨어지더라도 상당한 주관적 품질 향상을 이룬다.

ABSTRACT

It remains a tough challenge to recover the speech signals contaminated by various noises under real acoustic environments. To this end, we propose a novel system for denoising in the complicated applications, which is mainly comprised of two pipelines, namely a two-stage network and a post-processing module. The first pipeline is proposed to decouple the optimization problem w:r:t: magnitude and phase, i.e., only the magnitude is estimated in the first stage and both of them are further refined in the second stage. The second pipeline aims to further suppress the remaining unnatural distorted noise, which is demonstrated to sufficiently improve the subjective quality. In the ICASSP 2021 Deep Noise Suppression (DNS) Challenge, our submitted system ranked top-1 for the real-time track 1 in terms of Mean Opinion Score (MOS) with ITU-T P.808 framework.

연구 동기 및 목표

  • 다양한 노이즈 유형과 리버버버레이션을 포함한 복잡한 실세계 음향 환경에서의 음성 향상 문제를 해결하기 위해.
  • 특히 저SNR 및 비이상적인 조건에서 객관적 지표만으로는 측정할 수 없는 주관적 음성 품질 향상을 위해.
  • 학습 데이터와 테스트 조건이 다를 경우 비선형 왜곡을 다루는 데에 한계가 있는 단일 단계 네트워크의 문제점을 해결하기 위해.
  • 청취 보조기기, 음성 인식 시스템 및 통신 시스템에 적용 가능한 실시간, 저지연 시스템을 개발하기 위해.
  • 후처리가 객관적 점수는 약간 떨어지더라도 주관적 품질 향상에 기여할 수 있음을 검증하기 위해.

제안 방법

  • 시스템은 두 단계의 네트워크를 사용한다: 첫 번째 단계에서는 노이즈가 섞인 입력 신호에서 스펙트럼 크기를 근사적으로 추정하는 네트워크(CME-Net)를 적용한다.
  • 두 번째 단계에서는 노이즈가 섞인 스펙트럼과 근사 추정값을 함께 입력으로 받아 크기와 위상을 동시에 보정하는 복소 스펙트럼 보정 네트워크(CSR-Net)를 사용한다.
  • CSR-Net는 근사 추정값과 정제된 목표값 간의 차이만 예측하는 잔차 학습 방식을 적용하여 안정성과 정확도를 향상시킨다.
  • 두 단계의 네트워크 이후 경량 후처리(PP) 모듈을 적용하여 비자연스러운 잔여 노이즈 성분을 억제한다.
  • PP 모듈은 표준 지표가 포착하지 못하는 비음성 유사 왜곡을 대상으로 하여 주관적 품질 향상을 도모하도록 설계되어 있다.
  • 모델은 복소 스펙트럼 도메인에서 실제 및 허수 성분을 사용하여 훈련되며, 크기와 위상의 동시 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1크기와 위상 최적화를 분리함으로써 복잡한 실세계 환경에서 음성 향상 성능을 향상시킬 수 있는가?
  • RQ2두 단계 네트워크 아키텍처가 어려운 노이즈와 리버버버레이션을 다루는 데서 단일 단계 모델보다 우수한 성능을 내는가?
  • RQ3경량 후처리 모듈이 객관적 지표는 약간 떨어지더라도 주관적 음성 품질을 상당히 향상시킬 수 있는가?
  • RQ4크기 추정만으로는 부족한 위상 보정이 주관적 품질 향상에 얼마나 기여하는가?
  • RQ5노래, 톤성 언어 또는 감정 어조와 같은 드문 또는 어려운 음성 유형에 대해 시스템은 어떻게 성능을 내는가?

주요 결과

  • TSCN-PP 시스템은 ICASSP 2021 DNS 챌린지 실시간 트랙에서 평균 의견 점수(MOS) 3.38점을 기록하여 주관적 품질에서 1위를 차지했다.
  • 최첨단 기준 모델인 DCCRN과 비교해, 테스트 세트 전반에서 평균 PESQ 점수는 0.14점 향상되고 ESTOI 점수는 1.77% 향상되었다.
  • AB 테스트에서 후처리 모듈은 일관되게 주관적 선호도를 향상시켰으며, 100%의 청취자가 TSCN-PP를 TSCN 단독 버전보다 선호했다.
  • 후처리 이후 객관적 지표(PESQ 및 ESTOI)는 약간 감소했지만 MOS 점수는 상승하여 객관적 지표와 주관적 품질 간 격차가 있음을 시사했다.
  • 알고리즘 지연은 30ms(20ms 프레임 + 10ms 겹침)를 기록하여 실시간 지연 제약을 충족했으며, 프레임당 평균 처리 시간은 4.80ms였다.
  • 기준 모델인 NSnet2보다 전반적으로 0.17 MOS 포인트 향상되었으며, 특히 노래(3.14 vs. 3.10) 및 비영어어 음성(3.50 vs. 3.28)과 같은 어려운 조건에서 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.