[论文解读] Fitting New Speakers Based on a Short Untranscribed Sample
本文提出一种前馈神经网络TTS系统,通过联合训练专用说话人嵌入网络与主合成模型,实现仅用短时、未转录的音频样本即可适配新说话人。通过采用循环一致性和对比损失等一致性损失,该方法即使在1.5秒的极短样本下也能实现高质量的语音克隆,其在语音质量与说话人身份保持方面均优于先前的VoiceLoop方法。
Learning-based Text To Speech systems have the potential to generalize from one speaker to the next and thus require a relatively short sample of any new voice. However, this promise is currently largely unrealized. We present a method that is designed to capture a new speaker from a short untranscribed audio sample. This is done by employing an additional network that given an audio sample, places the speaker in the embedding space. This network is trained as part of the speech synthesis system using various consistency losses. Our results demonstrate a greatly improved performance on both the dataset speakers, and, more importantly, when fitting new voices, even from very short samples.
研究动机与目标
- 仅使用短时、未转录的音频样本,实现对新说话人的高质量文本到语音合成。
- 克服现有多说话人TTS系统对转录数据及大量说话人特定训练数据的依赖。
- 证明即使在真实场景下的短样本中,也能在无转录监督的情况下捕捉并合成说话人身份。
- 探究单个网络是否可通过提示(priming)方式模仿多个说话人,而无需迭代优化。
- 验证一致性损失(Lcycle 和 Lcontrast)在实现鲁棒、实时说话人嵌入学习方面的有效性。
提出的方法
- 引入一个说话人适配网络 Ns,以端到端方式将短时音频映射为说话人嵌入,替代传统的查找表(LUT)说话人嵌入。
- 联合训练 Ns 与 TTS 模型,采用多种一致性损失:Lcycle 确保从嵌入重建的输入音频能恢复出相同的嵌入,Lcontrast 则促使不同说话人的嵌入在嵌入空间中相互分离。
- 使用循环一致性损失(Lcycle)强制要求:从嵌入重建的音频,其嵌入应与原始输入音频的嵌入一致。
- 采用对比损失(Lcontrast)促使不同说话人的嵌入在嵌入空间中彼此远离,从而提升说话人判别能力。
- 将该方法集成至 VoiceLoop TTS 框架中,该框架支持使用原始音频或声码器特征进行端到端训练与推理。
- 系统在 VCTK 的子集(VCTK85)上进行训练,并在已训练说话人(VCTK16)及来自 VoxCeleb 和 LibriSpeech 的未见说话人上进行评估。
实验结果
研究问题
- RQ1神经TTS系统能否在无需转录的前提下,仅用短时、未转录的音频样本准确拟合新说话人的语音?
- RQ2一致性损失(Lcycle 和 Lcontrast)在无需优化的情况下,是否能有效实现鲁棒、实时的说话人嵌入学习?
- RQ3单个经提示的网络是否能在无显式说话人特定训练或微调的情况下模仿多个说话人?
- RQ4在仅包含85个多样化说话人的小规模数据集上进行训练,是否能实现对更大规模未见说话人群体的泛化能力?
- RQ5动态、实时的说话人嵌入系统是否能达到甚至超越固定预训练说话人嵌入的性能?
主要发现
- 在仅使用1.5秒测试数据的情况下,该方法在 VCTK16 上获得 3.84 ± 0.92 的 MOS 分数,显著优于 VoiceLoop 的 2.92 ± 1.08。
- 对于1.5秒的样本,该方法的 top-1 说话人识别准确率达到 73.72%,而 VoiceLoop 仅为 52.55%,表明其说话人嵌入质量更优。
- 消融实验表明,若移除 Lcycle,准确率降至 77.37%;若移除 Lcontrast,则降至 56.20%,证明两种损失对性能均至关重要。
- 在 VCTK16 上,该方法对适配语音的平均 MCD 为 14.47 ± 0.83,优于 VoiceLoop 的 14.72 ± 0.97。
- TSNE 可视化结果证实,Lcycle 显著提升了说话人嵌入的分离度,尤其在未见说话人上效果更明显。
- 基于提示的单网络方法仅需1秒音频即可实现合理的语音模仿,表明说话人身份可在无需迭代优化的情况下被有效捕捉。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。