Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Audiovisual Synthesis via Exemplar Autoencoders

Kangle Deng, Aayush Bansal|arXiv (Cornell University)|Jan 13, 2020
Speech and Audio Processing参考文献 70被引用 4
一句话总结

该论文提出了一种示例自编码器(Exemplar Autoencoders)用于无监督的音视频合成,仅需3分钟目标音视频数据,即可实现从任意输入说话人到目标说话人的零样本语音与面部动画迁移。通过学习一种个性化的瓶颈表征,将分布外的语音投影到目标说话人的风格上,同时保留语言内容,该方法在无需输入说话人数据或在大规模数据集上微调的情况下,实现了音视频合成的最先进性能。

ABSTRACT

We present an unsupervised approach that converts the input speech of any individual into audiovisual streams of potentially-infinitely many output speakers. Our approach builds on simple autoencoders that project out-of-sample data onto the distribution of the training set. We use Exemplar Autoencoders to learn the voice, stylistic prosody, and visual appearance of a specific target exemplar speech. In contrast to existing methods, the proposed approach can be easily extended to an arbitrarily large number of speakers and styles using only 3 minutes of target audio-video data, without requiring {\em any} training data for the input speaker. To do so, we learn audiovisual bottleneck representations that capture the structured linguistic content of speech. We outperform prior approaches on both audio and video synthesis, and provide extensive qualitative analysis on our project page -- https://www.cs.cmu.edu/~exemplar-ae/.

研究动机与目标

  • 实现从任意输入说话人到目标说话人的零样本音视频合成,且无需输入说话人的训练数据。
  • 学习一种个性化的音视频瓶颈表征,将语言内容与说话人特异的风格和语调解耦。
  • 仅使用3分钟目标数据即可实现高保真音视频合成,使该方法可扩展至任意多说话人。
  • 在真实网络数据(in-the-wild web data)上,其性能优于现有的零样本和有监督方法,在语音质量和视觉真实感方面表现更优。
  • 为医疗、教育和娱乐等应用提供即插即用、数据高效的解决方案。

提出的方法

  • 该方法采用示例自编码器,通过一个小的瓶颈表征将分布外的输入语音投影到单个目标说话人音视频数据的分布上。
  • 自编码器在3分钟目标音视频数据上端到端训练,学习重建目标说话人的语音、语调和视觉外观,同时保留语言内容。
  • 音频瓶颈捕捉结构化的语音内容,实现从任意输入说话人到目标说话人的内容保持风格迁移。
  • 通过联合训练以音频瓶颈为条件的视频解码器,利用预训练的音频特征提升视觉真实感,实现视频合成。
  • 采用WaveNet声码器实现高保真音频重建,避免依赖可能无法捕捉真实场景风格细节的预训练说话人嵌入。
  • 该方法数据效率高,且无需微调或成对数据,即可泛化到未见过的说话人和语言。

实验结果

研究问题

  • RQ1仅使用3分钟目标音视频数据,能否训练单个自编码器,实现对任意输入说话人的高质量音视频合成?
  • RQ2通过小瓶颈将输入语音投影到目标说话人分布上,是否能保留语言内容的同时实现风格迁移?
  • RQ3从目标说话人学习到的音频瓶颈能否有效用于合成无需额外训练数据的逼真面部视频?
  • RQ4在语音相似度和内容一致性方面,示例自编码器与零样本及有监督基线相比性能如何?
  • RQ5该方法能否泛化到真实、未经筛选的网络数据,并在不进行说话人特定微调的情况下仍实现高质量合成?

主要发现

  • 在Celeb-Audio数据集上,使用WaveNet时,该方法的语音相似度得分为99.6%,优于Auto-VC(98.5%)和Chou等人方法(57.0%)的说话人分类准确率。
  • 使用WaveNet时,该方法的平均谱距距离(MCD)为420.3,略高于Auto-VC(408.8),但仍能实现高感知质量。
  • 不使用WaveNet时,该方法仍优于非WaveNet基线,实现97.0%的语音相似度和420.3的MCD,表明其对声码器选择具有鲁棒性。
  • 在视频合成方面,训练视频解码器的同时微调音频解码器可提升性能,使VoxCeleb数据集上的MSE降低至76.401,PSNR提升至29.616。
  • 消融实验证实,使用预训练音频模型并微调音频瓶颈,相比从零开始训练或仅训练视频头,能显著提升视频合成质量。
  • 人工评估显示,该方法生成的输出在90.6%的时间内优于多说话人自编码器,证实其在风格迁移和真实感方面的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。