[논문 리뷰] Deep Noise Suppression With Non-Intrusive PESQNet Supervision Enabling the Use of Real Training Data
이 논문은 깨끗한 참조 없이 실제 노이즈 있는 음성 데이터로 훈련할 수 있도록 비침습적 PESQNet을 활용하는 약한 감독 기반의 딥 노이즈 제거 프레임워크를 제안한다. 합성 데이터와 실제 데이터를 번갈아가며 복잡한 마스크 기반 FCRN과 PESQNet을 훈련시킴으로써, DNS3 베이스라인 대비 0.09 MOS 향상과 배경 노이즈 품질에서 0.45 MOS 향상을 달성하였으며, 이는 GAN을 사용하지 않은 참조 없는 음성 강화 훈련에서 실제 데이터를 성공적으로 활용한 최초의 사례이다.
Data-driven speech enhancement employing deep neural networks (DNNs) can provide state-of-the-art performance even in the presence of non-stationary noise. During the training process, most of the speech enhancement neural networks are trained in a fully supervised way with losses requiring noisy speech to be synthesized by clean speech and additive noise. However, in a real implementation, only the noisy speech mixture is available, which leads to the question, how such data could be advantageously employed in training. In this work, we propose an end-to-end non-intrusive PESQNet DNN which estimates perceptual evaluation of speech quality (PESQ) scores, allowing a reference-free loss for real data. As a further novelty, we combine the PESQNet loss with denoising and dereverberation loss terms, and train a complex mask-based fully convolutional recurrent neural network (FCRN) in a "weakly" supervised way, each training cycle employing some synthetic data, some real data, and again synthetic data to keep the PESQNet up-to-date. In a subjective listening test, our proposed framework outperforms the Interspeech 2021 Deep Noise Suppression (DNS) Challenge baseline overall by 0.09 MOS points and in particular by 0.45 background noise MOS points.
연구 동기 및 목표
- 깨끗한 參照 신호가 없는 실제 노이즈 있는 음성 데이터를 사용하여 딥 음성 강화 모델을 훈련하는 문제를 해결하기 위해.
- 강화된 신호에서 직접 PESQ 점수를 추정함으로써 參照 없는 청각적 손실 함수를 개발하여 실제 데이터로 훈련할 수 있도록 하기 위해.
- 이전의 학습된 품질 측정 기준(예: Quality-Net)이 훈련 중에 모델이 이를 악용할 경우 성능이 저하되는 문제를 해결하기 위해.
- 합성 데이터와 실제 데이터를 약한 감독 훈련 프로토콜에 통합하여 실제 환경 테스트 데이터에서의 일반화 능력과 성능을 향상시키기 위해.
- 실제 데이터가 GAN을 사용하지 않은 청각 기반 음성 강화 훈련에 효과적으로 활용될 수 있음을 입증하기 위해.
제안 방법
- 청결한 參照 없이 강화된 음성 신호에서 PESQ 점수를 추정하는 엔드 투 엔드 비침습적 PESQNet을 제안하여 參照 없는 훈련을 가능하게 한다.
- FCRN과 PESQNet을 번갈아가며 업데이트하는 약한 감독 훈련 프로토콜(1-1-50)을 도입하며, 각 사이클에서 합성 데이터, 실제 데이터, 다시 합성 데이터를 사용하여 PESQNet이 최신 상태를 유지하도록 한다.
- 이전 연구에서 제안된 노이즈 제거 및 리버버브 제거 손실(Jsynth_u)과 PESQNet 손실을 결합하여 청각 품질과 신호 정밀도를 균형 잡는 총 손실 Jtotal_u를 구성한다.
- 합성 데이터(Jsynth_u)와 실제 데이터(PESQNet 손실)를 모두 사용하여 훈련하는 복잡한 마스크 기반 완전 컨volution 레이어 리커런트 네트워크(FCRN)를 사용한다.
- 최신 FCRN 출력을 사용하여 주기적으로 PESQNet을 재훈련하는 새로운 훈련 스케줄을 도입하여 분포 이탈을 방지하고 정확도를 유지한다.
- DNSMOS와 주관적 MOS(ITU-T P.835)를 사용하여 실제 환경 테스트 세트(예: DNS3 블라인드 테스트 세트 포함)에서 성능을 평가한다.
실험 결과
연구 질문
- RQ1청결한 參照 신호가 없는 상태에서 실제 노이즈 있는 음성 데이터를 효과적으로 사용하여 딥 음성 강화 모델을 훈련시킬 수 있는가?
- RQ2비침습적 PESQNet이 실제 데이터 훈련을 위한 안정적이고 미분 가능하며 청각적으로 의미 있는 손실을 제공할 수 있는가?
- RQ3강화 네트워크와 PESQNet 간의 교차 훈련이 분포 이탈 또는 모델 악용으로 인한 성능 저하를 방지할 수 있는가?
- RQ4PESQNet 손실을 통한 실제 데이터 통합이 완전히 합성 데이터 기반 훈련 대비 실제 환경 테스트 세트에서 성능 향상에 기여하는가?
- RQ5생성적 적대적 네트워크(GAN)를 사용하지 않고도 실제 데이터에서 최고 성능을 달성할 수 있는가?
주요 결과
- 제안된 프레임워크는 블라인드 테스트 세트에서 DNS3 챌린지 베이스라인 대비 총 품질에서 0.09 MOS 포인트 향상하여 상당한 주관적 향상을 입증하였다.
- 배경 노이즈 품질에서 0.45 MOS 포인트 향상하여 자연스러움과 노이즈 특성의 유지가 향상되었음을 시사한다.
- DNS3 개발 세트의 실제 데이터에서 모델은 DNSMOS 점수 3.33을 기록하여, 전체 실시간 데이터 접근이 가능한 오라클 설정을 제외한 모든 다른 방법보다 뛰어난 성능을 보였다.
- α=0.9인 1-1-50 훈련 프로토콜은 제한된 실제 데이터(4시간)에도 불구하고 합성 데이터 전용 베이스라인 대비 0.02점의 DNSMOS 향상을 보이며 실제 데이터의 효과적 활용을 입증하였다.
- FCRN과 PESQNet 간의 교차 훈련은 이전 연구에서 보고된 고정된 품질 네트워크의 성능 저하 문제를 성공적으로 완화하였으며, 시간이 지남에 따라 PESQNet의 신뢰성 유지에 기여하였다.
- 본 연구는 청각 기반, 參照 없는 손실을 사용하여 GAN을 사용하지 않은 실제 노이즈 있는 데이터 기반 음성 강화 모델 훈련이 효과적으로 가능함을 처음으로 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.