Skip to main content
QUICK REVIEW

[논문 리뷰] ConVoice: Real-Time Zero-Shot Voice Style Transfer with Convolutional Network

Yurii Rebryk, Stanislav Beliaev|arXiv (Cornell University)|2020. 05. 15.
Speech Recognition and Synthesis참고 문헌 26인용 수 5
한 줄 요약

ConVoice는 사전 훈련된 음성 인식(ASR) 및 화자 임베딩 모델을 사용하여 병렬 데이터나 텍스트 데이터 없이 실시간 비자율 음성 스타일 전환을 위한 경량이며 완전 컨볼루션형 비자율 신경망을 제안한다. 이는 단일 V100 GPU에서 321.58 RTF의 빠른 추론 속도와 높은 품질의 음성 합성 성능을 달성하며, 타겟 화자 음성 데이터가 몇 초 밖에 필요하지 않아 비자율 전환을 가능하게 한다.

ABSTRACT

We propose a neural network for zero-shot voice conversion (VC) without any parallel or transcribed data. Our approach uses pre-trained models for automatic speech recognition (ASR) and speaker embedding, obtained from a speaker verification task. Our model is fully convolutional and non-autoregressive except for a small pre-trained recurrent neural network for speaker encoding. ConVoice can convert speech of any length without compromising quality due to its convolutional architecture. Our model has comparable quality to similar state-of-the-art models while being extremely fast.

연구 동기 및 목표

  • 병렬 또는 텍스트 데이터가 없는 비자율 음성 전환의 과제를 해결한다.
  • 임의 길이의 음성 입력에 대해 실시간 추론이 가능한 빠른 음성 전환을 가능하게 한다.
  • 높은 음성 품질과 화자 유사도를 유지하면서 모델 크기와 계산 비용을 줄인다.
  • 병렬 데이터 수집이나 미세조정 없이, 타겟 화자 음성 데이터가 몇 초 밖에 되지 않아도 비자율 추론을 가능하게 한다.
  • 자기연쇄적 생성을 피하는 경량의 완전 컨볼루션 아키텍처를 개발하여 속도를 향상시킨다.

제안 방법

  • 소스 발화에서 언어적 특징을 추출하기 위해 사전 훈련된 QuartzNet-5x5 ASR 모델을 사용한다.
  • 화자 인식 작업에서 유도된 RNN 기반 화자 인코더를 활용하여 타겟 화자 음성에서 고정 차원의 화자 임베딩을 추출한다.
  • 소스 음성 특징과 타겟 화자 임베딩에 조건부로 멜스펙트로그램을 생성하기 위해 완전 컨볼루션 디코더를 사용한다.
  • 예측된 멜스펙트로그램에서 원시 음성 신호를 합성하기 위해 비자율 WaveGlow 보코더를 적용한다.
  • 사전 훈련된 ASR 모델의 중간 레이어 활성화를 콘텐츠 표현으로 활용하여 텍스트 데이터가 필요 없도록 한다.
  • 단지 몇 초의 타겟 화자 음성으로부터의 화자 임베딩에 조건을 주어, 새로운 화자에 대한 비자율 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1비자율, 완전 컨볼루션형 모델이 병렬 또는 텍스트 데이터 없이도 높은 품질의 비자율 음성 전환을 달성할 수 있는가?
  • RQ2제안된 ConVoice 모델의 성능은 음성 자연스러움과 화자 유사도 측면에서 최신 기술 수준의 방법과 비교해 어떻게 되는가?
  • RQ3장기 음성 입력을 처리할 경우 모델의 품질과 속도는 어느 정도 유지되는가?
  • RQ4최소한의 타겟 화자 데이터로 비자율 설정에서 모델의 효과는 어떠한가?
  • RQ5보코더 선택이 종합적인 추론 속도와 품질에 어떤 영향을 미치는가?

주요 결과

  • 배치 크기가 1인 경우 단일 V100 GPU에서 ConVoice는 추론 지연 시간이 0.011초(321.58 RTF)에 불과하여 보코더 없이도 실시간 성능을 달성한다.
  • 모델은 자연스러움에 대해 MOS 3.30, 화자 유사도에 대해 Hub/Spoke 기준 3.30/3.39의 높은 품질의 음성 합성을 생성하며, 최신 기술 수준의 N10 모델과 유사한 성능을 보인다.
  • 비자율 ConVoice는 화자 유사도 MOS가 Hub 기준 2.93, Spoke 기준 2.88을 기록하며, 미세조정 후에 크게 향상되어 배경 잡음이 거의 사라진다.
  • 모델의 작고 컴act한 크기(보코더 제외 11M 파라미터) 덕분에 빠르고 확장 가능한 추론이 가능하며, 품질 저하 없이 임의 길이의 입력을 처리할 수 있다.
  • 사전 훈련된 ASR 및 화자 모델을 활용함으로써 병렬 데이터나 광범위한 미세조정이 필요 없어지며, 몇 초의 타겟 화자 음성 데이터만으로도 진정으로 비자율 전환을 가능하게 한다.
  • WaveGlow를 더 효율적인 보코더인 WaveFlow나 SqueezeWave로 교체할 경우, 품질을 유지하면서도 종합적인 추론 속도를 더욱 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.