Skip to main content
QUICK REVIEW

[논문 리뷰] A Simultaneous Denoising and Dereverberation Framework with Target Decoupling

Andong Li, Wenzhe Liu|arXiv (Cornell University)|2021. 06. 24.
Speech and Audio Processing참고 문헌 38인용 수 7
한 줄 요약

이 논문은 사슬 최적화 전략을 사용하여 동시에 음성 노이즈 제거와 리버버버레이션 제거를 수행하는 네 단계의 딥러닝 프레임워크인 SDD-Net을 제안한다. 초기 단계에서 복합 스펙트럼 학습을 진폭만의 노이즈 제거와 리버버버레이션 제거로 분리하고, 잔여 학습을 통해 진폭과 위상 양쪽을 정밀하게 보정하며, 잔여 노이즈를 억제하기 위해 경량 후처리 모듈을 적용함으로써 Interspeech 2021 DNS 챌린지 실시간 트랙에서 최고의 MOS 성능을 달성하였다.

ABSTRACT

Background noise and room reverberation are regarded as two major factors to degrade the subjective speech quality. In this paper, we propose an integrated framework to address simultaneous denoising and dereverberation under complicated scenario environments. It adopts a chain optimization strategy and designs four sub-stages accordingly. In the first two stages, we decouple the multi-task learning w.r.t. complex spectrum into magnitude and phase, and only implement noise and reverberation removal in the magnitude domain. Based on the estimated priors above, we further polish the spectrum in the third stage, where both magnitude and phase information are explicitly repaired with the residual learning. Due to the data mismatch and nonlinear effect of DNNs, the residual noise often exists in the DNN-processed spectrum. To resolve the problem, we adopt a light-weight algorithm as the post-processing module to capture and suppress the residual noise in the non-active regions. In the Interspeech 2021 Deep Noise Suppression (DNS) Challenge, our submitted system ranked top-1 for the real-time track in terms of Mean Opinion Score (MOS) with ITU-T P.835 framework

연구 동기 및 목표

  • 실세계 음향 환경에서 배경 노이즈와 실내 리버버버레이션으로 인한 음성 품질 저하 문제를 해결하기 위해.
  • 다단계 사슬 최적화 프레임워크를 통해 노이즈 제거와 리버버버레이션 제거를 공동 최적화하여 주관적 음성 품질을 향상시키기 위해.
  • DNN 기반 처리에서 발생하는 잔여 아티팩트를 줄이기 위해 비활성 음성 영역을 대상으로 하는 경량 후처리 모듈을 도입하기 위해.
  • 노이즈 제거 외에 명시적인 리버버버레이션 제거가 인간이 인식하는 음성 품질 향상에 기여하는지 검증하기 위해.
  • 실제 구현에 적합한 낮은 지연 시간과 계산 비용을 확보하면서 실시간 성능을 달성하기 위해.

제안 방법

  • 프레임워크는 사슬 최적화 전략을 활용하여, 복잡한 스펙트럼 학습을 네 개의 하위 단계로 분해하여 노이즈 제거, 리버버버레이션 제거, 스펙트럼 정밀화를 순차적으로 처리한다.
  • 첫 번째 및 두 번째 단계에서는 노이즈 및 후기 리버버버레이션 억제를 위해 오직 진폭 성분만을 처리하며, 다중 작업 학습 문제를 분리함으로써 단순화한다.
  • 세 번째 단계에서는 이전 단계의 사전 추정치를 기반으로 한 글로벌 잔여 연결을 사용하여 진폭과 위상을 동시에 정밀하게 보정한다.
  • 경량 후처리 모듈을 적용하여 비활성 음성 영역의 잔여 노이즈를 억제함으로써 DNN 비선형성으로 인한 아티팩트를 해결한다.
  • 확률적 사슬 법칙을 활용하여 목표 추정을 p(X|Y) = p(N|Y)p(R|Y,N)p(X|Y,R,N)로 인수분해함으로써 단계별 최적화를 가능하게 한다.
  • STFT를 사용한 시간-주파수 도메인 표현을 기반으로 엔드 투 엔드로 학습하며, 30ms의 처리 지연를 유지한다.

실험 결과

연구 질문

  • RQ1다단계 사슬 최적화 프레임워크는 단일 단계 DNN보다 동시에 노이즈 제거 및 리버버버레이션 제거 성능을 뛰어나게 할 수 있는가?
  • RQ2진폭과 위상 추정을 분리함으로써 복합 스펙트럼 도메인 내에서 양 성분의 복구 성능이 향상되는가?
  • RQ3목표 성능 지표에서 저하될 수 있음에도 불구하고, 잔여 노이즈의 후처리가 주관적 음성 품질 향상에 얼마나 기여하는가?
  • RQ4노이즈 제거 외에 명시적인 리버버버레이션 제거가 PESQ 및 ESTOI 외의 평가 지표인 평균의견점수(MOS) 향상에 기여하는가?
  • RQ5낮은 지연 시간과 계산 비용을 확보하면서 실시간 성능을 달성할 수 있는가?

주요 결과

  • 제안된 SDD-Net 프레임워크는 Interspeech 2021 DNS 챌린지 실시간 트랙에서 블라인드 테스트 세트에서 MOS 72.94로 최고의 평균의견점수를 기록하여 1위를 달성하였다.
  • 프레임워크에 리버버버레이션 제거 기능을 통합함으로써 MOS가 크게 향상되었으며, 고주관적 품질 향상을 위해 후기 리버버버레이션 억제의 명시적 처리가 필수적임을 입증하였다.
  • PESQ 및 ESTOI와 같은 목표 성능 지표는 약간 하락했지만, 후처리 모듈이 MOS 향상에 뚜렷한 기여를 하여 목표 지표와 인간 인식 간 격차를 드러내었다.
  • 프레임워크는 30ms의 처리 지연를 확보했으며, 초당 6.00 GMACS의 계산 비용만을 요구하여 실시간 응용에 적합하였다.
  • ITU-T P.835를 활용한 주관적 평가에서 SDD-Net은 모든 음성 품질 항목에서 베이스라인을 초월했고, 일부 경우에서는 노이즈가 있는 기준보다도 더 우수한 성능을 보여, 효과적인 음성 보존 능력을 입증하였다.
  • 638만 개의 학습 가능한 파라미터와 효율적인 아키텍처 덕분에 낮은 지연 시간 추론이 가능했으며, 표준 CPU에서 한 프레임 처리 시간은 약 4.40ms였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.