Skip to main content
QUICK REVIEW

[논문 리뷰] Noisy-target Training: A Training Strategy for DNN-based Speech Enhancement without Clean Speech

Takuya Fujimura, Yuma Koizumi|arXiv (Cornell University)|2021. 01. 21.
Speech and Audio Processing인용 수 7
한 줄 요약

이 논문은 청소된 음성 데이터가 필요 없이 노이즈가 섞인 신호로만 훈련하는 DNN 기반 음성 강화 방법인 노이즈 타겟 훈련(NyTT)을 제안한다. 동일한 음성 신호의 점점 더 노이즈가 섞인 변형을 입력과 타겟으로 사용함으로써, 훈련 및 테스트 데이터 간의 불일치가 있을 경우 청소된 타겟 훈련과 비교할 만한 성능을 달성하며, 노이즈가 효과적인 '청소된' 타겟이 될 수 있는 조건을 SNR 임계값으로 규명한다.

ABSTRACT

Deep neural network (DNN)-based speech enhancement ordinarily requires clean speech signals as the training target. However, collecting clean signals is very costly because they must be recorded in a studio. This requirement currently restricts the amount of training data for speech enhancement to less than 1/1000 of that of speech recognition which does not need clean signals. Increasing the amount of training data is important for improving the performance, and hence the requirement of clean signals should be relaxed. In this paper, we propose a training strategy that does not require clean signals. The proposed method only utilizes noisy signals for training, which enables us to use a variety of speech signals in the wild. Our experimental results showed that the proposed method can achieve the performance similar to that of a DNN trained with clean signals.

연구 동기 및 목표

  • DNN 기반 음성 강화에서 청소된 음성 데이터의 높은 비용과 부족함 문제를 해결하기 위해.
  • 스튜디오에서 녹음한 청소된 음성을 요구하지 않고 노이즈가 섞인 신호만으로 훈련하는 것을 가능하게 하기 위해.
  • 청소된 데이터가 가용하지 않을 경우 노이즈가 효과적인 훈련 타겟이 될 수 있는지 조사하기 위해.
  • 노이즈 타겟 훈련이 청소된 타겟 훈련과 비교해 성능이 유사해지는 조건을 규명하기 위해.
  • 노이즈 분포와 SNR가 제안된 방법의 효과성에 미치는 영향을 분석하기 위해.

제안 방법

  • 이 방법은 더 심하게 손상된 버전 $\bm{x}' = \bm{x} + \bm{n}$ 에서 원래의 노이즈가 섞인 신호 $\bm{x} = \bm{s} + \bm{n}^{(\text{obs})}$ 를 예측하도록 DNN을 훈련시킨다. 여기서 $\bm{n}$ 은 추가적인 노이즈이다.
  • 훈련 데이터는 기존의 노이즈가 섞인 신호 $\bm{x}$ 에 다양한 노이즈 $\bm{n}$ 을 더하여 합성되며, 이로써 청소된 음성을 필요로 하지 않는다.
  • 이 방법은 Noise2Noise에 영감을 받았지만 음성에 맞게 조정되어 타겟이 청소된 것이 아니라 노이즈가 섞인 것으로 되어 있다.
  • 모델은 추가적인 노이즈 $\bm{n}$ 만 제거하도록 학습하며, 원래의 노이즈 $\bm{n}^{(\text{obs})}$ 는 그대로 유지한다.
  • 이 방법은 추가 노이즈 $\bm{n}$ 의 분포가 관측된 노이즈 $\bm{n}^{(\text{obs})}$ 와 겹치는 것을 전제로 한다.
  • 실험은 STFT 기반의 T-F 마스크 추정을 사용하며, SI-SDR 및 PESQ 메트릭을 통해 평가된다.

실험 결과

연구 질문

  • RQ1청소된 음성 타겟이 전혀 없이도 DNN이 음성 강화에 효과적으로 훈련될 수 있는가?
  • RQ2NyTT가 청소된 타겟 훈련과 비교해 성능이 유사해지기 위해 노이즈 타겟 신호의 최소 SNR는 얼마여야 하는가?
  • RQ3추가 노이즈 $\bm{n}$ 의 분포는 NyTT의 성능에 어떤 영향을 미치는가?
  • RQ4훈련 및 테스트 데이터 분포 간 불일치가 있을 경우, NyTT는 표준 훈련보다 더 잘 일반화되는가?
  • RQ5SNR ≥ 15 dB 인 노이즈 신호는 청소된 음성의 효과적인 대체재로 간주될 수 있는가?

주요 결과

  • NyTT는 추가 노이즈로 TAU-2020를 사용했을 때 SI-SDR가 12.09 dB 향상되어 청소된 타겟 훈련의 12.18 dB에 근접하였다.
  • 노이즈 타겟 $\bm{x}$ 의 SNR가 15 dB 이상일 경우, NyTT의 성능은 청소된 타겟 훈련과 거의 구분되지 않았다.
  • $\bm{x}$ 의 SNR가 0 dB 이하일 경우 성능이 크게 떨어졌으며, 이는 메서드가 실패하는 임계값 이하임을 시사한다.
  • Task2 노이즈(오피스 사운드 이벤트)를 사용한 NyTT는 성능이 열악했으며(SI-SDR 9.63 dB), 이는 $\bm{n}^{(\text{obs})}$ 와의 노이즈 분포가 겹치지 않았기 때문이다.
  • t-SNE 시각화 결과, 효과적인 노이즈 유형(DEMAND, TAU-2020, CHiME3)은 $\bm{n}^{(\text{obs})}$ 와 분포가 겹쳤지만, Task2는 그렇지 않았다.
  • 이 방법은 청소된 음성을 요구하지 않고도 DNN을 성공적으로 훈련시켜, 데이터 불일치 조건에서 청소된 타겟 훈련과 유사한 성능을 달성하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.