Skip to main content
QUICK REVIEW

[논문 리뷰] Noisy-to-Noisy Voice Conversion Framework with Denoising Model

Chao Xie, Yi-Chiao Wu|arXiv (Cornell University)|2021. 09. 22.
Speech Recognition and Synthesis참고 문헌 6인용 수 7
한 줄 요약

이 논문은 사전에 훈련된 정제 모델(DCCRN)을 VQ-VAE 기반 VC 모델과 통합하여, 화자 전환 중 배경 음향을 유지하는 노이지 투 노이지(N2N) 음성 변환(VC) 프레임워크를 제안한다. 방법은 입력에서 음성과 노이즈를 분리하고, 청소된 음성에 대해 VC를 적용한 후 원래의 배경 노이즈를 재결합하여, 더 자연스럽고 화자 유사도가 높으면서도 맥락적 음향의 정합성을 유지하면서 직접적인 노이지 투 노이지 훈련에 비해 뛰어난 성능을 달성한다.

ABSTRACT

In a conventional voice conversion (VC) framework, a VC model is often trained with a clean dataset consisting of speech data carefully recorded and selected by minimizing background interference. However, collecting such a high-quality dataset is expensive and time-consuming. Leveraging crowd-sourced speech data in training is more economical. Moreover, for some real-world VC scenarios such as VC in video and VC-based data augmentation for speech recognition systems, the background sounds themselves are also informative and need to be maintained. In this paper, to explore VC with the flexibility of handling background sounds, we propose a noisy-to-noisy (N2N) VC framework composed of a denoising module and a VC module. With the proposed framework, we can convert the speaker's identity while preserving the background sounds. Both objective and subjective evaluations are conducted, and the results reveal the effectiveness of the proposed framework.

연구 동기 및 목표

  • 기존 VC가 비용이 많이 들는 청소된 데이터셋에 의존하는 한계를 해결하기 위해, 저품질의 노이지 음성 데이터로 훈련할 수 있도록 하는 것.
  • 실제 응용 분야인 영상 처리 및 ASR 데이터 증강에 적합한, 변환 중 배경 음향을 유지하는 유연한 VC 프레임워크를 개발하는 것.
  • 훈련 데이터에 배경 노이즈가 포함되어 있을 때, 사전에 훈련된 정제 모델이 VC 성능을 향상시키는지 조사하는 것.
  • 다른 정제 모델(DCCRN 대비 Conv-TasNet)이 최종 VC 품질과 내성에 미치는 영향을 비교하는 것.
  • 다양한 신호 대 노이즈 비(SNR) 조건에서 목적적 지표와 주관적 听음 테스트를 통해 제안된 프레임워크를 평가하는 것.

제안 방법

  • 두 단계 프레임워크를 사용: 먼저 사전에 훈련된 DCCRN 정제 모델이 노이지 입력을 청소된 음성과 배경 노이즈 성분으로 분리한다.
  • 청소된 음성을 사용해 VQ-VAE 기반 음성 변환 모델을 훈련시키며, 언어적 내용을 유지하면서 화자 신원을 전달하는 것을 학습한다.
  • 추론 단계에서 동일한 정제 모델이 원천 발화를 처리하여 청소된 음성과 배경 노이즈 신호를 별도로 추출한다.
  • 변환된 음성을 원래의 배경 노이즈와 재결합하여, 입력의 음향 환경을 유지하는 최종 출력을 생성한다.
  • 프레임워크는 배경 노이즈를 재결합하거나 억제할 수 있는 탄력적인 제어를 가능하게 한다.
  • DCCRN과 Conv-TasNet을 모두 정제 구성 요소로 사용하여 VC 성능에 미치는 영향을 비교 평가한다.

실험 결과

연구 질문

  • RQ1노이지 음성 데이터로만 훈련된 음성 변환 시스템이 배경 음향을 유지하면서도 고품질의 출력을 달성할 수 있는가?
  • RQ2사전에 훈련된 정제 모델(예: DCCRN)을 통합함으로써, 직접 노이지 데이터로 훈련하는 것에 비해 노이지 투 노이지 음성 변환의 성능이 어떻게 향상되는가?
  • RQ3다른 정제 아키텍처(DCCRN 대비 Conv-TasNet)가 변환된 음성의 자연스러움과 화자 유사도에 어떤 영향을 미치는가?
  • RQ4정제 모델이 유도하는 아티팩트가 VC 파이프라인의 최종 변환 음성 품질에 얼마나 큰 영향을 미치는가?
  • RQ5제안된 프레임워크는 청소된 데이터에서의 VC 성능에 가까운 성능을 달성하면서도 맥락적 배경 음향을 유지할 수 있는가?

주요 결과

  • DCCRN-VC 프레임워크는 평균 평가 점수(MOS) 3.08과 화자 유사도(SIM) 점수 51.6을 기록하여, 베이스라인 Noisy-VC(MOS: 2.07, SIM: 39.4)에 비해 유의미하게 뛰어난 성능을 보였다.
  • DCCRN-VC의 성능은 다양한 SNR 수준(7 dB 및 15 dB)에서 안정적이었으며, 노이즈 변동에 대한 강건성을 보였다.
  • ConvTas-VC도 DCCRN-VC와 유사한 MOS 점수(3.08)를 기록하여, Conv-TasNet에서 발생하는 잔여 노이즈가 재결합 시 청각적으로 미미한 영향을 미친다는 것을 시사했다.
  • DCCRN의 뛰어난 정제 성능에도 불구하고, 유도된 아티팩트가 약간의 음성 품질 저하를 유발하여, MOS 향상이 ConvTas-VC에 비해 제한되었다.
  • 제안된 프레임워크는 노이지 투 노이지 VC에서 거의 최신 기술 수준의 성능을 달성했으며, 직접적인 노이지 투 노이지 훈련에 비해 명확한 성능 격차를 보였고, VC 파이프라인에서 사전 정제의 가치를 입증했다.
  • 주관적 평가 결과, 재결합된 배경 음향이 잘 유지되고 청각적으로 자연스럽다는 것이 확인되어, 실세계 응용에 적합함을 뒷받침했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.