Skip to main content
QUICK REVIEW

[논문 리뷰] NANSY++: Unified Voice Synthesis with Neural Analysis and Synthesis

Hyeong-Seok Choi, Jinhyeok Yang|arXiv (Cornell University)|2022. 11. 17.
Speech Recognition and Synthesis인용 수 8
한 줄 요약

NANSY++는 음성 변환, 텍스트-to-음성, 노래 음성 합성, 음성 설계를 포함한 다양한 음성 합성 작업을 위한 통합된 자기지도 학습 프레임워크를 제안한다. 이 프레임워크는 음성 특성인 편도, 진폭, 언어학적 특성, 톤을 분리된 모듈식 분석 특징으로 분리하여 고성능, 고효율의 합성 구현을 가능하게 한다. 짝지어진 레이블 없이 백본 네트워크를 엔드 투 엔드로 훈련시킴으로써, 최신 기술 수준의 품질과 강력한 분리 능력을 갖춘 빠르고 데이터 효율적이며 제어 가능한 음성 생성을 실현한다.

ABSTRACT

Various applications of voice synthesis have been developed independently despite the fact that they generate "voice" as output in common. In addition, most of the voice synthesis models still require a large number of audio data paired with annotated labels (e.g., text transcription and music score) for training. To this end, we propose a unified framework of synthesizing and manipulating voice signals from analysis features, dubbed NANSY++. The backbone network of NANSY++ is trained in a self-supervised manner that does not require any annotations paired with audio. After training the backbone network, we efficiently tackle four voice applications - i.e. voice conversion, text-to-speech, singing voice synthesis, and voice designing - by partially modeling the analysis features required for each task. Extensive experiments show that the proposed framework offers competitive advantages such as controllability, data efficiency, and fast training convergence, while providing high quality synthesis. Audio samples: tinyurl.com/8tnsy3uc.

연구 동기 및 목표

  • 음성 변환, 텍스트-to-음성, 노래 음성 합성, 음성 설계와 같은 다양한 음성 합성 응용을 하나의 모듈식 프레임워크로 통합하는 것.
  • 텍스트-음성, 점수-음성 등의 대규모 짝지어진 데이터셋에 대한 의존도를 줄이기 위해 백본 네트워크를 자기지도 학습 방식으로 훈련하는 것.
  • 핵심 음성 특성들을 독립적이고 해석 가능한 표현으로 분리함으로써 제어 능력을 향상시키는 것.
  • 고성능의 합성 품질을 유지하면서도 하류 작업을 위한 빠르고 모듈식의 미세조정을 가능하게 하는 것.

제안 방법

  • 고정된-Q 변환(CQT) 특징에 대한 자동에코드를 통한 자기지도 학습 방식의 F0 추정을 통해 지도가 필요한 F0 레이블이 필요 없도록 백본 네트워크를 훈련한다.
  • 정보 훼손 및 브로크릿 방법을 활용해 원시 wav2vec 스타일의 특징에서 분리된 언어학적 표현을 학습한다.
  • 시작 시점에서의 음성 톤을 모델링하기 위해 콘텐츠 기반의 시간에 따라 변하는 화자 임베딩을 도입하여 추론 시 제로샷 화자 적응을 가능하게 한다.
  • 플로우 기반 정규화 플로우 아키텍처(ActNorm, ShuffleLayer, AffineCouplingLayer 포함)를 사용해 F0, 톤 임베딩, 톤 토큰의 잠재 변수를 모델링한다.
  • 음성 생성 네트워크에 인간의 음성 생성 모델에 대한 인덕티브 바이어스를 적용하여 웨이브폼 품질을 향상시킨다.
  • 하류 작업을 위해 필요한 분석 특징의 부분집합만을 합성함으로써 동일한 백본과 합성 네트워크를 공유함으로써 하류 작업을 가능하게 한다.

실험 결과

연구 질문

  • RQ1단일 자기지도 학습 백본 네트워크가 음성 변환, 텍스트-to-음성, 노래 음성 합성, 음성 설계 등 다양한 음성 합성 작업을 위해 핵심 음성 특성(편도, 진폭, 언어학적 특성, 톤)을 효과적으로 분리할 수 있는가?
  • RQ2자기지도 사전학습이 하류 음성 응용의 데이터 요구량을 얼마나 줄이고, 미세조정 속도를 얼마나 가속화하는가?
  • RQ3짝지어진 레이블 없이도 편도, 톤, 연령/성별과 같은 분리된 특성들을 얼마나 잘 제어할 수 있는가?
  • RQ4통합 프레임워크가 공유 구성 요소를 통해 음성 변환, TTS, SVS, 음성 설계 전반에서 고성능의 합성 품질을 달성할 수 있는가?
  • RQ5제안된 플로우 기반 잠재 모델링이 연령과 성별 편집에 특히 효과적인가?

주요 결과

  • NANSY++는 음성 변환, 텍스트-to-음성, 노래 음성 합성, 음성 설계의 네 가지 하류 작업 전반에서 최신 기술 수준의 합성 품질을 달성하였으며, 짝지어진 훈련 데이터가 전혀 필요로 하지 않는다.
  • 모델은 하류 응용의 빠른 미세조정을 가능하게 하였으며, 공유된 백본 가중치 덕분에 훈련 수렴 속도가 크게 향상되었다.
  • 자기지도 F0 추정 방법은 후처리나 합성 데이터 없이도 높은 정확도를 달성하였으며, 제로샷 설정에서 기준 모델들을 능가하였다.
  • 분리된 표현 학습 덕분에 편도, 진폭, 톤에 대한 정밀한 제어가 가능했으며, 정량적 결과로 기준 모델 대비 더 뛰어난 분리 품질이 입증되었다.
  • NANSY-VOD에서 제안된 연령/성별 편집 알고리즘은 연령과 성별 인식 간의 비선형 관계를 고려하여 어린이에서 성인으로의 음성 변환에서 성능을 8배 향상시켰다.
  • SPNet은 성별 분류 정확도 93.75%와 연령 추정의 평균 절대 오차 4.095를 달성하여 음성 편집을 위한 신뢰할 수 있는 화자 특성 조건화를 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.