Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Audiovisual Synthesis via Exemplar Autoencoders

Kangle Deng, Aayush Bansal|arXiv (Cornell University)|2020. 01. 13.
Speech and Audio Processing참고 문헌 70인용 수 4
한 줄 요약

이 논문은 비지도 음성시각 합성용 예시 자동에코더를 제안하며, 타겟 음성-영상 데이터 3분만으로도 어떤 입력 화자에서든 제로샷 음성 및 얼굴 애니메이션 전이를 가능하게 한다. 입력 화자의 스타일을 타겟 화자의 스타일로 투영하면서 언어적 내용을 유지하는 개인화된 복잡도 표현을 학습함으로써, 입력 화자 데이터나 대규모 데이터셋에서의 미세조정이 필요 없이도 음성 및 영상 합성에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

We present an unsupervised approach that converts the input speech of any individual into audiovisual streams of potentially-infinitely many output speakers. Our approach builds on simple autoencoders that project out-of-sample data onto the distribution of the training set. We use Exemplar Autoencoders to learn the voice, stylistic prosody, and visual appearance of a specific target exemplar speech. In contrast to existing methods, the proposed approach can be easily extended to an arbitrarily large number of speakers and styles using only 3 minutes of target audio-video data, without requiring {\em any} training data for the input speaker. To do so, we learn audiovisual bottleneck representations that capture the structured linguistic content of speech. We outperform prior approaches on both audio and video synthesis, and provide extensive qualitative analysis on our project page -- https://www.cs.cmu.edu/~exemplar-ae/.

연구 동기 및 목표

  • 입력 화자에 대한 훈련 데이터가 필요 없이 어떤 입력 화자에서든 제로샷 음성시각 합성을 가능하게 하기 위해.
  • 언어적 내용과 화자 고유의 스타일 및 억양을 분리하는 개인화된 음성시각 복잡도 표현을 학습하기 위해.
  • 타겟 데이터 3분만으로도 고해상도 음성 및 영상 합성을 가능하게 하여, 임의의 많은 화자에 대해 확장 가능한 방법을 확보하기 위해.
  • 실제 웹 데이터에서의 제로샷 및 지도 학습 기반 접근법보다 음성 품질과 시각적 현실감에서 뛰어난 성능을 달성하기 위해.
  • 헬스케어, 교육, 엔터테인먼트 분야의 응용을 위해 즉시 사용할 수 있고 데이터 효율적인 솔루션을 제공하기 위해.

제안 방법

  • 이 방법은 소규모 복잡도 표현을 사용하여, 단일 타겟 화자의 음성시각 데이터 분포에 비표본 입력 음성을 투영하는 예시 자동에코더를 활용한다.
  • 자동에코더는 타겟의 목소리, 억양, 시각적 외형을 재구성하면서 언어적 내용을 유지하는 방식으로 3분의 타겟 음성-영상 데이터에서 엔드 투 엔드로 훈련된다.
  • 음성 복잡도 표현은 구조적인 발음 내용을 캡처하여, 어떤 입력 화자에서든 타겟으로의 내용 유지를 보장하는 스타일 전이를 가능하게 한다.
  • 영상 합성은 음성 복잡도 표현에 조건을 두고 공동으로 훈련된 영상 디코더를 통해 달성되며, 개선된 현실감을 확보하기 위해 사전 훈련된 음성 특징을 활용한다.
  • 고해상도 음성 재구성을 위해 WaveNet 보이서를 사용하며, 실생활의 스타일적 세부 정보를 포착하지 못할 수 있는 사전 훈련된 화자 임베딩에 의존하지 않는다.
  • 이 방법은 데이터 효율적이며, 재학습이나 쌍화된 데이터 없이도 예측 불가능한 화자와 언어로 일반화된다.

실험 결과

연구 질문

  • RQ1단지 3분의 타겟 음성-영상 데이터로만 훈련된 단일 자동에코더가 어떤 입력 화자에서든 고품질 음성시각 합성을 가능하게 할 수 있는가?
  • RQ2소규모 복잡도 표현을 통해 입력 음성을 타겟 화자의 분포에 투영함으로써 언어적 내용을 유지하면서 스타일 전이가 가능할 수 있는가?
  • RQ3타겟 화자로부터 학습된 음성 복잡도 표현이 추가 훈련 데이터 없이도 현실적인 얼굴 영상 합성을 효과적으로 수행할 수 있는가?
  • RQ4예시 자동에코더의 성능은 제로샷 및 지도 학습 기반 베이스라인 대비 음성 유사도와 내용 일관성 측면에서 어떻게 비교되는가?
  • RQ5이 방법은 실생활 웹 데이터와 같이 정제되지 않은 데이터에 대해서도 일반화되어 고품질 합성을 달성할 수 있으며, 화자별 미세조정 없이도 성능을 유지할 수 있는가?

주요 결과

  • Wave넷을 사용할 경우, 제안된 방법은 셀레브-오디오 데이터셋에서 99.6%의 음성 유사도 점수를 기록하여 Auto-VC(98.5%)와 쑤오 등(57.0%)을 능가한다.
  • WaveNet을 사용할 경우, 평균 코스패이스 거리(MCD)는 420.3으로 Auto-VC(408.8)보다 略히 높지만 여전히 높은 청각적 품질을 제공한다.
  • WaveNet 없이도 비-WaveNet 기반 베이스라인보다 성능이 뛰어나며, 97.0%의 음성 유사도와 420.3의 MCD를 기록하여 보이서 선택에 대한 강건성을 입증한다.
  • 영상 합성에서는 영상 디코더 훈련 동안 음성 디코더를 미세조정함으로써 성능이 향상되어 VoxCeleb에서 MSE는 76.401로 감소하고 PSNR는 29.616로 증가한다.
  • 제거 분석 결과, 사전 훈련된 음성 모델을 사용하고 음성 복잡도 표현을 미세조정하는 것이, 초기 학습 또는 영상 헤드만 학습하는 것보다 영상 합성 품질을 크게 향상시킨다.
  • 인간 평가 결과, 제안된 방법의 출력이 다중 화자 자동에코더보다 90.6%의 비율로 선호되며, 스타일 전이와 현실감에서 뛰어난 성능을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.