Skip to main content
QUICK REVIEW

[논문 리뷰] Differentiable WORLD Synthesizer-based Neural Vocoder With Application To End-To-End Audio Style Transfer

Shahan Nercessian|arXiv (Cornell University)|2022. 08. 15.
Speech and Audio Processing인용 수 6
한 줄 요약

이 논문은 학습 가능한 파rameter가 없이 고음질, 주파수 유지 신경 음성합성 기능을 갖춘 엔드 투 엔드 오디오 스타일 전이를 위한 미분 가능 WORLD 합성기( synthesizer )를 제안한다. 미분 가능 신호 처리와 선택적 경량 후행 네트워크를 활용하여, 특히 음성 변환 및 톤 전이 작업에서 뛰어난 재구성 품질과 안정적인 학습을 달성한다.

ABSTRACT

In this paper, we propose a differentiable WORLD synthesizer and demonstrate its use in end-to-end audio style transfer tasks such as (singing) voice conversion and the DDSP timbre transfer task. Accordingly, our baseline differentiable synthesizer has no model parameters, yet it yields adequate synthesis quality. We can extend the baseline synthesizer by appending lightweight black-box postnets which apply further processing to the baseline output in order to improve fidelity. An alternative differentiable approach considers extraction of the source excitation spectrum directly, which can improve naturalness albeit for a narrower class of style transfer applications. The acoustic feature parameterization used by our approaches has the added benefit that it naturally disentangles pitch and timbral information so that they can be modeled separately. Moreover, as there exists a robust means of estimating these acoustic features from monophonic audio sources, it allows for parameter loss terms to be added to an end-to-end objective function, which can help convergence and/or further stabilize (adversarial) training.

연구 동기 및 목표

  • 신경 오디오 합성에서 위상 일관성과 주파수 윤곽을 유지하는 미분 가능한 WORLD 음성합성기의 개발.
  • 학습 목표에 미분 가능한 신호 처리를 통합하여 오디오 스타일 전이 시스템의 엔드 투 엔드 학습을 가능하게 하기.
  • 특정 응용 분야에서 자연스러움을 향상시키기 위해 직접적인 흥분 스펙트럼 조작을 포함한 대체적인 미분 가능한 아키텍처 탐색.
  • 비모수적이고 미분 가능한 합성기로도 경쟁 수준의 합성 품질을 달성하면서 주파수와 톤을 분리 모델링할 수 있음을 입증하기.
  • 진짜 음성 특징 파rameter를 보조 신호로 포함시켜 신경 음성합성기에서의 적대적 학습을 안정화시키기.

제안 방법

  • 기본적인 미분 가능한 WORLD 합성기는 원래 WORLD 알고리즘의 미분 가능한 구현을 사용하여 기본 주파수(f0), 스펙트럼 에너지(sp), 비주기성(ap)로부터 오디오를 재구성한다.
  • 합성기 출력에 경량의 비자기적 후행 네트워크를 추가하여 스펙트럼 정밀도를 향상시키고 잡음을 줄인다.
  • 대체 방법으로 직접 흥분 스펙트럼을 조작하여 원래 소스 신호의 조화 성분을 유지하면서 새로운 스펙트럼 에너지를 적용한다.
  • 음성 특징 표현은 자연스럽게 주파수(f0)와 톤(sp, ap)를 분리하므로, 파rameter 손실 항목을 통한 별도의 모델링과 감독이 가능하다.
  • 로그 멜 스펙트로그램에 대한 L1 손실과, 필요에 따라 판별기와 특징 손실을 사용한 적대적 학습을 포함한 엔드 투 엔드 학습을 수행한다.
  • 진짜 WORLD 파rameter를 특징 손실 감독의 타겟으로 사용하여, 적대적 학습의 수렴성과 안정성을 향상시킨다.

실험 결과

연구 질문

  • RQ1학습 가능한 파rameter가 없는 미분 가능한 WORLD 음성합성기로 고음질 오디오 합성을 달성할 수 있는가?
  • RQ2미분 가능한 WORLD 합성은 엔드 투 엔드 오디오 스타일 전이 시스템에서 학습 안정성과 수렴성에 어떻게 기여하는가?
  • RQ3후행 네트워크 모듈은 비자기적, 미분 가능한 음성합성기 아키텍처에서 합성 품질 향상에 어느 정도 기여하는가?
  • RQ4전체 웨이브폼 합성 대비 흥분 스펙트럼 직접 조작이 톤 전이 작업에서 더 자연스러운 결과를 낼 수 있는가?
  • RQ5음성 특징 파rameter(f0, sp, ap)는 엔드 투 엔드 학습에서 효과적인 보조 신호로 사용될 수 있는가, 성능 향상에 기여하는가?

주요 결과

  • 미분 가능한 WORLD 합성기는 노래 음성 변환(SVC) 작업에서 멜 스펙트로그램 재구성 오차 0.2050을 기록하여 강력한 비모수적 기준선을 제공한다.
  • 후행 네트워크와 적대적 학습을 적용한 변형(E2E+DiffWORLDSynth+Postnet+GAN)은 약간 높은 재구성 오차(0.2215)를 보였지만, 더 뛰어난 청취 품질과 더 정교한 스펙트럼 세부 정보를 확보했다.
  • 오라클 감독 변형(E2E+DiffWORLDSynth+Oracle)은 WORLD로 합성된 타겟과 비교하여 매우 낮은 오차 0.1014를 기록하여 진짜 음성 특징 감독의 이점을 입증했다.
  • 흥분 기반 방법(E2E+DiffWORLDExcite)은 가장 낮은 재구성 오차 0.0421을 기록하여 흥분 스펙트럼을 정확히 추정할 경우 뛰어난 성능을 보였다.
  • 미분 가능한 합성기는 DDSP 톤 전이 작업의 엔드 투 엔드 학습을 효과적으로 가능하게 하여 재구성 오차 0.2465를 달성했으며, 이는 음성 변환 외 응용 분야로의 일반화 가능성을 보여준다.
  • 적대적 학습은 L1 오차가 약간 증가하더라도 형성대 대역폭을 조여서 청취 품질을 향상시켰고, 번짐 현상을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.