Skip to main content
QUICK REVIEW

[논문 리뷰] Training Speech Enhancement Systems with Noisy Speech Datasets

Koichi Saito, Stefan Uhlich|arXiv (Cornell University)|2021. 05. 26.
Speech and Audio Processing참고 문헌 23인용 수 6
한 줄 요약

이 논문은 청소된 음성 데이터가 아닌, Mozilla Common Voice와 같은 노이즈가 섞인 음성 데이터셋을 사용하여 딥 러닝 기반 음성 강화(SE) 시스템을 훈련시키기 위한 두 가지 방법을 제안한다. 첫째, 샘플 축을 기준으로 중앙값을 계산한 후 시간-주파수(T-F) 버킷을 평균 내는 강건한 손실 함수를 도입하여 노이즈에 의한 오차를 감소시킨다. 둘째, 혼합 불변 훈련(MixIT)을 위한 노이즈 증강 기법을 제시하여 일반화 성능을 향상시킨다. 주요 결과로는 각각 PESQ 점수가 최대 0.19점과 0.27점 향상되었으며, 청소된 타겟이 없는 노이즈가 섞인 데이터로도 효과적인 훈련이 가능함을 보여준다.

ABSTRACT

Recently, deep neural network (DNN)-based speech enhancement (SE) systems have been used with great success. During training, such systems require clean speech data - ideally, in large quantity with a variety of acoustic conditions, many different speaker characteristics and for a given sampling rate (e.g., 48kHz for fullband SE). However, obtaining such clean speech data is not straightforward - especially, if only considering publicly available datasets. At the same time, a lot of material for automatic speech recognition (ASR) with the desired acoustic/speaker/sampling rate characteristics is publicly available except being clean, i.e., it also contains background noise as this is even often desired in order to have ASR systems that are noise-robust. Hence, using such data to train SE systems is not straightforward. In this paper, we propose two improvements to train SE systems on noisy speech data. First, we propose several modifications of the loss functions, which make them robust against noisy speech targets. In particular, computing the median over the sample axis before averaging over time-frequency bins allows to use such data. Furthermore, we propose a noise augmentation scheme for mixture-invariant training (MixIT), which allows using it also in such scenarios. For our experiments, we use the Mozilla Common Voice dataset and we show that using our robust loss function improves PESQ by up to 0.19 compared to a system trained in the traditional way. Similarly, for MixIT we can see an improvement of up to 0.27 in PESQ when using our proposed noise augmentation.

연구 동기 및 목표

  • 청소된 음성 데이터가 부족하거나 가용하지 않을 경우 딥 뉴럴 네트워크 기반 음성 강화(SE) 시스템을 훈련시키는 데 도전하는 것.
  • Mozilla Common Voice와 같이 다양성은 풍부하지만 청소된 타겟이 없는 공개된 노이즈가 섞인 음성 데이터셋을 효과적으로 활용하여 훈련을 가능하게 하는 것.
  • 기존 방법인 MixIT의 한계를 극복하기 위해, 타겟의 노이즈 분포와 인위적 노이즈의 분포가 다를 경우 성능이 떨어지는 문제를 해결하는 것.
  • 노이즈가 섞인 훈련 타겟에 강건한 손실 함수와 데이터 증강 전략을 설계하여 일반화 능력과 성능을 향상시키는 것.

제안 방법

  • 샘플 축을 기준으로 중앙값을 계산한 후 시간-주파수(T-F) 버킷을 평균 내는 수정된 손실 함수를 제안하여 노이즈가 섞인 타겟에 대한 민감도를 감소시킨다.
  • 실제 노이즈와 인위적 노이즈 간의 노이즈 분포가 일관되게 유지되도록 하는 MixIT를 위한 노이즈 증강 기법을 도입하여 MixIT의 독립 혼합 가정을 충족시킨다.
  • 스펙트로그램을 사용하여 입력 표현을 구성하며, 1024점 FFT와 256ms 오버랩을 사용한 UMX 기반 모델에 수정된 손실 함수를 적용한다.
  • MixIT 훈련에는 SDR 손실을 사용하고, 배치 크기 16, 1000 에포크, 조기 정지 기법을 적용한 Adam 옵timizer를 사용한다.
  • 인위적 노이즈 증강을 위해 DEMAND 데이터셋을 활용하여 훈련 중에 다양한 실재성 있는 노이즈를 확보한다.
  • 주로 PESQ를 평가 지표로 사용하여 VBD, DNS dry, DNS 리버버버런트 테스트 세트에서 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1샘플 축을 기준으로 중앙값을 계산한 후 T-F 버킷 평균을 취하는 수정된 손실 함수는 노이즈가 섞인 음성 데이터셋에서 훈련할 때 음성 강화 성능 향상에 기여하는가?
  • RQ2타겟이 본질적으로 노이즈가 섞여 있을 경우, MixIT 훈련에서 노이즈 증강이 일반화 능력과 성능 향상에 기여하는가?
  • RQ3노이즈가 섞인 데이터에서 훈련할 때, 제안된 손실 함수는 표준 MSE 손실과 비교해 PESQ 점수 향상에서 어떤가?
  • RQ4노이즈 분포가 타겟과 인위적 노이즈에서 다를 경우, MixIT가 노이즈가 섞인 음성 데이터셋에 효과적으로 적용될 수 있는가?

주요 결과

  • 노이즈가 섞인 Mozilla Common Voice 데이터에서 훈련할 때, 제안된 '샘플 중앙값, T-F 버킷 평균' 손실 함수는 표준 MSE 손실 대비 최대 0.19점의 PESQ 향상을 달성했다.
  • 이 손실 함수는 VBD 테스트 세트에서 청소된 VBD 데이터로 훈련된 모델과 비교해 유사한 PESQ 점수를 기록했다.
  • MCV 유효 또는 비유효 데이터에서 훈련하고 VBD에서 평가할 때, 제안된 MixIT를 위한 노이즈 증강 기법은 최대 0.27점의 PESQ 향상을 이룩했다.
  • 새로운 손실 함수와 증강 기법을 사용한 모델은 DNS dry 및 리버버버런트 테스트 세트에서 성능 향상을 보이며 더 나은 일반화 능력을 보였다.
  • 수동 점검 결과, 증강된 MixIT 설정은 음성 강도가 균형 잡힌 출력 구성 요소를 생성한 반면, 수정되지 않은 버전은 음성을 제대로 분리하지 못했다.
  • 전통적 훈련 방식과 원본 MixIT보다 제안된 방법이 노이즈가 많고 리버버버런트한 테스트 세트에서 더 뛰어난 성능을 보이며, 강건성과 일반화 능력이 뛰어나다는 것을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.