[논문 리뷰] DenoiSpeech: Denoising Text to Speech with Frame-Level Noise Modeling
DenoiSpeech는 프레임 수준의 노이즈를 함께 학습된 노이즈 조건 모듈을 사용하여 노이즈가 섞인 훈련 데이터로부터 고품질의 청소된 음성으로 합성하는 텍스트-to-스피치 시스템을 제안한다. 실제 노이즈가 섞인 데이터에서 이전 방법들—문장 수준의 노이즈 임베딩 또는 사전 강화된 음성 사용—보다 각각 0.31 및 0.66 MOS 높은 성능을 기록하여, 복잡한 노이즈 환경에서 뛰어난 강건성과 청각적 품질을 입증한다.
While neural-based text to speech (TTS) models can synthesize natural and intelligible voice, they usually require high-quality speech data, which is costly to collect. In many scenarios, only noisy speech of a target speaker is available, which presents challenges for TTS model training for this speaker. Previous works usually address the challenge using two methods: 1) training the TTS model using the speech denoised with an enhancement model; 2) taking a single noise embedding as input when training with noisy speech. However, they usually cannot handle speech with real-world complicated noise such as those with high variations along time. In this paper, we develop DenoiSpeech, a TTS system that can synthesize clean speech for a speaker with noisy speech data. In DenoiSpeech, we handle real-world noisy speech by modeling the fine-grained frame-level noise with a noise condition module, which is jointly trained with the TTS model. Experimental results on real-world data show that DenoiSpeech outperforms the previous two methods by 0.31 and 0.66 MOS respectively.
연구 동기 및 목표
- 목표 화자에 대해 이용 가능한 훈련 데이터가 노이즈가 섞인 음성일 경우 고품질 텍스트-to-스피치 모델을 훈련하는 데 도전하는 것.
- 일반적인 노이즈 임베딩 또는 사전 강화된 음성을 사용하는 이전 방법의 한계를 극복하여, 시간에 따라 변화하는 복잡한 노이즈 환경에서 실패하는 문제를 해결하는 것.
- 세밀한 시간적 변동 노이즈 패턴을 모델링하여 실생활의 노이즈 환경에서 음성 합성 품질을 향상시키는 것.
- 스피치 콘텐츠가 아닌 순수한 노이즈 정보만을 학습하도록 하는 적대적 CTC 손실을 통해 의미 유출을 방지하기 위해 노이즈 추출기의 학습을 보장하는 것.
제안 방법
- DenoiSpeech는 TTS 디코더에 프레임 수준의 노이즈 정보를 주입하기 위해 공동으로 학습된 노이즈 조건 모듈을 갖춘 수정된 FastSpeech 2 아키텍처를 사용한다.
- 노이즈 조건 모듈은 쌍체 및 비쌍체 훈련 데이터를 모두 사용하여 노이즈가 섞인 음성 입력에서 배경 노이즈를 분리하는 UNet 기반의 노이즈 추출기를 포함한다.
- 노이즈 인코더는 추출된 노이즈를 잠재 표현으로 변환하여 TTS 모델의 은닉 상태와 연결함으로써 합성 과정을 노이즈 특성에 따라 조절한다.
- 적대적 CTC 모듈은 노이즈와 빈 토큰 간의 정렬을 강제하여, 노이즈 추출기가 음성의 발음 또는 언어적 콘텐츠를 학습하지 않도록 보장한다.
- 노이즈 추출기와 TTS 모델은 TTS 손실, 피치 예측 손실, 적대적 CTC 손실을 조합한 다중 작업 손실을 통해 종단 간 최적화를 위해 공동으로 훈련된다.
- 추론 과정에서는 노이즈 인코더에 침묵을 입력하여 배경 노이즈 없이 청소된 음성을 생성할 수 있도록 한다.
실험 결과
연구 질문
- RQ1훈련 데이터가 노이즈가 섞여 있고 복잡한 시간에 따라 변화하는 노이즈를 포함할 경우, 프레임 수준의 노이즈 모델링이 텍스트-to-스피치 품질을 향상시킬 수 있는가?
- RQ2청각적 품질과 강건성 측면에서 문장 수준의 노이즈 임베딩과 비교해 프레임 수준의 노이즈 조건 조절 방식은 어떠한가?
- RQ3노이즈 추출기를 TTS 모델과 함께 공동으로 훈련하면 실생활 노이즈 데이터에서 일반화 능력과 성능이 향상되는가?
- RQ4적대적 CTC 모듈이 노이즈 표현에 의미 정보가 유출되는 것을 방지하는 데 어떤 영향을 미치는가?
- RQ5쌍체가 없는 노이즈 데이터로만 훈련된 경우 이 방법의 효과는 어떠한가?
주요 결과
- DenoiSpeech는 실생활 노이즈가 섞인 데이터에서 평균 평가 점수(MOS)가 3.35를 기록하여, 다음으로 우수한 베이스라인(Enhancement-Based)보다 0.66 MOS 높다.
- 인위적인 노이즈가 섞인 데이터에서는 DenoiSpeech가 MOS 3.77을 기록하여 Enhancement-Based 방법보다 0.31 MOS 높고, Augment-Adversarial 방법보다 0.34 MOS 높다.
- 프레임 수준의 노이즈 조건 조절은 문장 수준의 조건 조절 대비 0.59 CMOS 향상되어 시간적 해상도의 중요성을 입증한다.
- 노이즈 추출기를 TTS 훈련 중 고정할 경우 성능이 0.16 CMOS 감소하여 공동 훈련이 일반화에 기여함을 확인한다.
- 적대적 CTC 모듈을 제거할 경우 0.09 CMOS 감소하여, 이 모듈이 순수한 노이즈 특징을 음성 콘텐츠로부터 분리하는 데 효과적임을 증명한다.
- 실생활 데이터에 대한 성능 향상이 인위적 데이터보다 더 크므로, 복잡한 실생활 노이즈에 대해 더 뛰어난 강건성을 보임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.