Skip to main content
QUICK REVIEW

[논문 리뷰] On Loss Functions and Recurrency Training for GAN-based Speech Enhancement Systems

Zhuohuang Zhang, Chengyun Deng|arXiv (Cornell University)|2020. 07. 29.
Speech and Audio Processing참고 문헌 35인용 수 8
한 줄 요약

이 논문은 국소적인 주파수-시간 상관관계를 위해 컨볼루션 네트워크(CNN)와 장기적인 시간적 모델링을 위해 양방향 LSTM(BiLSTM) 레이어를 조합한 컨볼루션 순환 GAN(CRGAN)을 제안한다. 모델은 평균 제곱오차(MSE)를 포함한 메트릭 손실을 사용하여 최신 기준 성능(SOTA)을 달성하며, PESQ, STOI, CSIG, CBAK, COVL 등 모든 메트릭에서 GAN 기반 및 비-GAN 기반 시스템을 능가한다. 최적의 설정에서 PESQ는 2.92, STOI는 0.940를 기록한다.

ABSTRACT

Recent work has shown that it is feasible to use generative adversarial networks (GANs) for speech enhancement, however, these approaches have not been compared to state-of-the-art (SOTA) non GAN-based approaches. Additionally, many loss functions have been proposed for GAN-based approaches, but they have not been adequately compared. In this study, we propose novel convolutional recurrent GAN (CRGAN) architectures for speech enhancement. Multiple loss functions are adopted to enable direct comparisons to other GAN-based systems. The benefits of including recurrent layers are also explored. Our results show that the proposed CRGAN model outperforms the SOTA GAN-based models using the same loss functions and it outperforms other non-GAN based systems, indicating the benefits of using a GAN for speech enhancement. Overall, the CRGAN model that combines an objective metric loss function with the mean squared error (MSE) provides the best performance over comparison approaches across many evaluation metrics.

연구 동기 및 목표

  • GAN 프레임워크 내에서 컨볼루션 및 순환 아키텍처를 조합함으로써 음성 강화 성능 향상 여부를 조사하는 것.
  • 손실 함수의 차이가 GAN 기반 음성 강화 시스템에 미치는 영향을 평가하는 것.
  • GAN 프레임워크를 통한 적대적 훈련이 비-GAN 기반 기준 모델에 비해 우월한 성능을 내는지 확인하는 것.
  • GAN 기반 음성 강화 모델에서 순환 레이어의 기여도를 정량화하는 것.
  • CRGAN 기반 음성 강화에 최적의 손실 함수 구성 방법을 규명하는 것.

제안 방법

  • 2D 컨볼루션 레이어와 양방향 LSTM(BiLSTM) 레이어를 사용한 인코더-디코더 구조를 갖는 새로운 CRGAN 아키텍처를 제안하여 국소적 및 장기적 음성 의존성을 모델링한다.
  • 생성자 및 판별자 훈련을 위해 상대적 평균(Ra), 메트릭, 평균 제곱오차(MSE) 등의 다중 손실 함수를 통합한다.
  • 이중 단계 적대적 훈련 과정을 적용한다: 먼저 진짜(오라클) 마스크와 가짜(생성된) 마스크를 기반으로 판별자를 훈련하고, 이후 생성자가 판별자를 속이도록 훈련한다.
  • 생성자 내에서 단방향 LSTM을 양방향 LSTM(BiLSTM)으로 대체하여 CRN 아키텍처를 확장함으로써 시간적 모델링 성능을 향상시킨다.
  • 메트릭 손실과 MSE를 융합한 하이브리드 손실을 활용하여 청취 품질 향상과 재구성 정확도 향상을 도모한다.
  • 제거 실험을 통해 성능 기여도를 분리한다: 순환 레이어가 제거된 CRGAN 및 개별 손실 함수를 갖춘 CRGAN의 변종을 평가한다.

실험 결과

연구 질문

  • RQ1GAN 기반 음성 강화 모델에 순환 레이어를 통합할 경우 순수하게 컨볼루션 기반 GAN보다 성능 향상이 이루어지는가?
  • RQ2음성 품질 및 이해 가능성 측면에서 최고의 성능을 내는 손실 함수 조합은 무엇인가?
  • RQ3CRGAN 기반 시스템이 최신 기준 비-GAN 기반 음성 강화 모델을 능가할 수 있는가?
  • RQ4GAN 프레임워크를 통한 적대적 훈련이 비-GAN 훈련 대비 강화 품질 측면에서 어떻게 비교되는가?
  • RQ5CRGAN 아키텍처에서 순환 레이어의 상대적 기여도는 무엇인가?

주요 결과

  • M-CRGAN-MSE 모델은 최고의 PESQ 점수 2.92와 STOI 0.940를 기록하여 모든 다른 GAN 기반 및 비-GAN 기반 시스템을 능가한다.
  • 메트릭 손실과 MSE를 결합한 CRGAN 모델은 CSIG(4.16), CBAK(3.24), COVL(3.54)에서 뛰어난 성능을 보이며, 더 나은 음성 무결성과 낮은 노이즈 침투를 의미한다.
  • 순환 레이어를 제거하면 성능이 급격히 저하되며, PESQ는 M-CRGAN-MSE의 2.92에서 Ra-CGAN의 2.38로 감소하여 시간적 모델링의 중요성을 확인한다.
  • CRGAN 모델은 최고의 기존 GAN 기반 시스템(RaSGAN, PESQ: 2.57)과 비-GAN 기반 기준 모델(BiLSTM, PESQ: 2.70)을 모두 능가하여 적대적 훈련이 적절한 아키텍처와 함께 제공할 경우 우수한 성능을 낼 수 있음을 보여준다.
  • 메트릭 손실에 MSE를 결합한 솔루션은 모든 메트릭에서 가장 일관된 향상을 보이며, CRGAN 기반 음성 강화에 있어 가장 효과적인 손실 함수임을 시사한다.
  • 상대적 평균 손실을 사용한 CRGAN 모델(Ra-CRGAN)은 PESQ 2.81과 STOI 0.936을 기록하여 뛰어난 성능를 보였지만, 여전히 M-CRGAN-MSE 버전에 미치지 못한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.