[논문 리뷰] MetricGAN-U: Unsupervised speech enhancement/ dereverberation based only on noisy/ reverberated speech
MetricGAN-U는 정제된 음성 또는 노이즈 레퍼런스가 필요 없이, 단지 잡음이 있는 또는 반향이 있는 음성에서만 훈련하여 비침습적 음성 품질 지표를 최적화하는 완전히 비지도 학습 기반의 음성 강화 및 반향 제거 프레임워크를 제안한다. 실험 결과, 객관적 및 주관적 평가에서 기존의 베이스라인을 능가하며 엄격한 비지도 조건에서 최신 기술 수준의 성능을 보여준다.
Most of the deep learning-based speech enhancement models are learned in a supervised manner, which implies that pairs of noisy and clean speech are required during training. Consequently, several noisy speeches recorded in daily life cannot be used to train the model. Although certain unsupervised learning frameworks have also been proposed to solve the pair constraint, they still require clean speech or noise for training. Therefore, in this paper, we propose MetricGAN-U, which stands for MetricGAN-unsupervised, to further release the constraint from conventional unsupervised learning. In MetricGAN-U, only noisy speech is required to train the model by optimizing non-intrusive speech quality metrics. The experimental results verified that MetricGAN-U outperforms baselines in both objective and subjective metrics.
연구 동기 및 목표
- 훈련에 짝지어진 정제된 음성과 잡음이 있는 음성 쌍이 필요한 감독 기반 음성 강화 모델의 한계를 해결하기 위해.
- 기존 비지도 방법들이 여전히 훈련 중에 정제된 음성 또는 노이즈를 필요로 하는 제약을 극복하기 위해.
- 단지 잡음이 있거나 반향이 있는 음성에서만 훈련되며, 음성 품질 지표만을 감독 신호로 사용하는 프레임워크를 개발하기 위해.
- 정제된 레퍼런스 데이터가 가용하지 않은 실제 환경에서의 음성 강화 및 반향 제거 성능을 향상시키기 위해.
- 비침입적 객관적 지표만을 사용한 엔드 투 엔드 훈련의 가능성을 입증하기 위해.
제안 방법
- 생성적 적대적 네트워크(GAN) 프레임워크를 사용하며, 디스크림이터는 실제 잡음이 있는 음성과 생성기에서 생성된 강화된 음성을 구분하도록 훈련된다.
- 생성기는 PESQ, STOI, MOS와 같은 비침입적 음성 품질 지표를 기반으로 한 손실 함수를 통해 최적화되며, 이 지표들은 미리 훈련된 지표 예측기에서 예측된다.
- 지표 예측기는 별도의 신경망으로, 실제 정제된 음성 데이터가 필요 없이 음성 품질을 추정한다.
- 훈련은 엔드 투 엔드로 수행되며, 짝지어진 정제된 데이터나 노이즈 추정치가 필요 없이 오직 잡음이 있거나 반향이 있는 음성 샘플만을 사용한다.
- 강화된 출력의 안정성과 품질을 향상시키기 위해 사이클 일致성 유사성 유사 정규화 기법을 활용한다.
- 디스크림이터는 실제 잡음이 있는 음성과 강화된 음성을 구분하도록 훈련되며, 생성기는 디스크림을 속이고 지표 점수를 향상시키기 위해 최적화된다.
실험 결과
연구 질문
- RQ1정제된 음성 레퍼런스 없이도 음성 강화를 효과적으로 훈련시킬 수 있는가?
- RQ2비침입적 음성 품질 지표가 엔드 투 엔드 훈련에서 감독 신호로 신뢰할 수 있는 대체 수단이 될 수 있는가?
- RQ3지표 기반 손실을 사용하는 GAN 기반 프레임워크가 기존의 비지도 기반 베이스라인보다 음성 강화 및 반향 제거에서 더 우수한 성능을 내는가?
- RQ4모델은 짝지어진 데이터 없이 실제의 잡음이 많고 반향이 있는 환경에 일반화될 수 있는가?
- RQ5객관적 및 주관적 평가에서 MetricGAN-U의 성능은 감독 및 약한 감독 기반 베이스라인과 비교해 어떻게 되는가?
주요 결과
- MetricGAN-U는 훈련에 오직 잡음이 있거나 반향이 있는 음성만을 사용하여 음성 강화 및 반향 제거 분야에서 최신 기술 수준의 성능를 달성한다.
- PESQ 및 STOI와 같은 객관적 지표에서 기존의 비지도 및 약한 감독 기반 베이스라인보다 뚜렷이 뛰어난 성능을 보인다.
- 주관적 평균 의견 점수(MOS) 평가 결과, 강화된 음성이 베이스라인 방법보다 청취자에게 더 우수한 것으로 평가된다.
- 비침입적 지표를 훈련 신호로 사용함으로써, 정제된 음성 감독 없이도 효과적인 최적화가 가능하다.
- 모델은 다양한 잡음이 많고 반향이 있는 환경에서 잘 일반화되어 실제 응용에서의 강건성을 보여준다.
- 제거 분석 결과, 지표 기반 손실과 적대적 훈련이 최적 성능 달성에 모두 필수적임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.