[논문 리뷰] Speech Enhancement In Multiple-Noise Conditions using Deep Neural Networks
이 논문은 러닝 노이즈 추정과 심리음향 가중 훈련을 사용하여 다수의 동시 발생하는 정적 및 비정적 노이즈가 존재하는 실생활 사무실 환경에서의 딥 네ural 네트워크(DNN) 기반 음성 향상 방법을 제안한다. 최고의 모델은 다양한 신호대노이즈비(SNR)에서 노이즈가 섞인 음성 대비 평균 PESQ 향상률이 23.97%에 달하며, 복잡한 다중노이즈 조건에서 기존의 Log-MMSE와 같은 전통적 방법을 크게 능가한다.
In this paper we consider the problem of speech enhancement in real-world like conditions where multiple noises can simultaneously corrupt speech. Most of the current literature on speech enhancement focus primarily on presence of single noise in corrupted speech which is far from real-world environments. Specifically, we deal with improving speech quality in office environment where multiple stationary as well as non-stationary noises can be simultaneously present in speech. We propose several strategies based on Deep Neural Networks (DNN) for speech enhancement in these scenarios. We also investigate a DNN training strategy based on psychoacoustic models from speech coding for enhancement of noisy speech
연구 동기 및 목표
- 실생활 사무실 환경에서 정적 및 비정적 노이즈가 동시에 공존하는 조건에서 음성 향상을 해결하기 위해.
- 단일 노이즈 또는 일치하는 노이즈 조건을 넘어서 DNN 기반 음성 향상의 강인성을 향상시키기 위해 복잡한 다중원인 노이즈 손상 모델링을 위해.
- 정적 노이즈 신호 대신 러닝 노이즈 추정치를 사용한 노이즈 인식 훈련의 효과를 조사하기 위해.
- 최적화 과정에서 청취적으로 중요한 주파수 대역을 우선시하기 위해 심리음향 가중 DNN 훈련을 평가하기 위해.
- 학습 중에 나타나지 않은, 불일치하는, 그리고 매우 비정적 노이즈 조건에서도 일반화 능력과 성능 향상을 입증하기 위해.
제안 방법
- 다양한 노이즈 유형(사무실 배경음, 프린터, 타자기 등)을 포함한 총 100시간의 데이터로 훈련된 DNN 아키텍처를 제안하여 복잡한 다중노이즈 환경을 모델링한다.
- 프레임 단위로 러닝 노이즈 추정치를 입력 특징으로 도입하여 비정적 노이즈에 대한 성능 향상을 이룬다. 특히 저 SNR 조건에서 두드러진다.
- 음성 인식에서 영감을 얻은 노이즈 인식 훈련 전략을 적용하여 동적 노이즈 추정치를 활용해 강인성을 향상시킨다.
- 심리음향 원리를 적용하여 DNN 손실 함수를 가중함으로써 청취적으로 중요한 주파수 대역을 최적화 과정에서 우선시한다.
- 입력으로 멜 주파수 체프스트럼 특징을 사용하고, 엔드 투 엔드 DNN 학습을 통해 청소된 음성 스펙트럼 크기를 예측한다.
- BD, BSD, BED, BEWD 등의 다양한 DNN 변종을 평가하며, BEWD는 노이즈 인식 훈련과 가중 훈련을 모두 통합한다.
실험 결과
연구 질문
- RQ1DNN 기반 음성 향상 기법은 실생활 사무실 환경에서 흔히 발생하는 정적 및 비정적 노이즈가 동시에 존재하는 조건에서 효과적으로 작동할 수 있는가?
- RQ2비정적 노이즈 조건에서 정적 노이즈 신호 대비 러닝 노이즈 추정치를 입력 특징으로 사용할 경우 DNN 성능 향상이 이루어지는가?
- RQ3저 SNR 및 다중노이즈 조건에서 심리음향 가중 DNN 훈련이 음성 품질과 명료성 향상에 어느 정도 기여하는가?
- RQ4학습 중에 나타나지 않은 또는 불일치하는 노이즈 조건에서 모델의 일반화 능력은 어떻게 평가되는가?
- RQ5다양한 노이즈 데이터로 훈련된 DNN는 특히 저 SNR 조건에서 다양한 신호대노이즈비(SNR) 수준에서 강인한 성능을 달성할 수 있는가?
주요 결과
- 최고의 DNN 모델(BEWD)은 모든 SNR에서 노이즈가 섞인 음성 대비 평균 PESQ 향상률이 23.97%에 달하며, -5 dB SNR 조건에서는 30% 이상의 향상률을 기록한다.
- -5 dB SNR 조건에서 BED DNN는 노이즈가 섞인 음성 대비 STOI에서 15~16% 향상률을 기록하며, Log-MMSE를 크게 능가한다.
- 프레임 단위로 러닝 노이즈 추정치를 입력 특징으로 사용할 경우 비정적 노이즈에 대한 추적 능력 향상으로 인해 저 SNR 조건에서 두드러진 성능 향상이 이루어진다.
- 심리음향 가중 훈련은 특정 시험 케이스에서 측정 가능한 성능 향상을 보이며, 평균 향상률은 특히 매우 낮은 SNR 조건에서 두드러진다.
- 더 큰 훈련 데이터(100시간)는 더 작은 데이터(25시간)보다 일관되게 뛰어난 성능을 보이며, 모든 SNR 수준에서 PESQ 및 STOI 모두 향상된다.
- 스펙트로그램 및 청취 결과를 통해 BEWD는 Log-MMSE보다 더 명확하고 명료한 음성을 생성하는 것으로 확인되었으며, 고강도 비정적 노이즈 조건에서는 Log-MMSE가 실패함을 확인할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.