[论文解读] Voice Imitating Text-to-Speech Neural Networks
该论文提出了一种神经文本到语音模型,仅使用6秒的语音样本即可模仿新说话人的声音,无需转录文本或额外训练。通过将说话人嵌入网络与Tacotron结合,该模型能够实时生成高质量、说话人特定的语音,其语音质量与多说话人TTS模型相当,同时实现了对各种输入的即时语音模仿。
We propose a neural text-to-speech (TTS) model that can imitate a new speaker's voice using only a small amount of speech sample. We demonstrate voice imitation using only a 6-seconds long speech sample without any other information such as transcripts. Our model also enables voice imitation instantly without additional training of the model. We implemented the voice imitating TTS model by combining a speaker embedder network with a state-of-the-art TTS model, Tacotron. The speaker embedder network takes a new speaker's speech sample and returns a speaker embedding. The speaker embedding with a target sentence are fed to Tacotron, and speech is generated with the new speaker's voice. We show that the speaker embeddings extracted by the speaker embedder network can represent the latent structure in different voices. The generated speech samples from our model have comparable voice quality to the ones from existing multi-speaker TTS models.
研究动机与目标
- 仅使用6秒的语音样本,无需转录或额外训练,实现实时语音模仿新说话人。
- 开发一种神经TTS系统,仅通过一段简短的音频片段即可生成具有目标说话人语音特征的自然语音。
- 探索说话人嵌入提取的通用性,使说话人嵌入网络能够处理语音以外的多种输入模态。
- 与标准多说话人TTS模型相比,评估生成语音的感知质量和说话人可区分性。
提出的方法
- 训练一个说话人嵌入网络,从新说话人的简短音频片段中提取紧凑的说话人嵌入。
- 将说话人嵌入与文本输入拼接,并输入到经过修改的Tacotron模型中,以生成同时依赖于文本和说话人声音的语音。
- 端到端微调基于Tacotron的TTS模型与说话人嵌入网络,实现语音克隆与语音生成的联合优化。
- 使用主成分分析(PCA)可视化学习到的说话人嵌入的潜在结构,评估其捕捉语音特征的能力。
- 通过Amazon Mechanical Turk的众包调查,对本模型与基线多说话人TTS模型在语音质量和说话人可区分性方面进行定量比较。
- 设计说话人嵌入网络以具备跨输入源的泛化能力,为未来扩展至视频等多模态输入(如情感感知语音合成)提供可能。
实验结果
研究问题
- RQ1神经TTS模型能否仅使用6秒的音频样本,在无转录或额外训练的情况下模仿新说话人的声音?
- RQ2所提出的语音模仿TTS模型的语音质量与标准多说话人TTS模型相比如何?
- RQ3在仅使用极少量数据训练的情况下,生成的语音在多大程度上能保留独特的说话人身份特征?
- RQ4说话人嵌入网络能否泛化到其他输入模态(如视频),以实现多模态语音合成?
主要发现
- 在众包比较调查中,所提出的语音模仿TTS模型的平均得分为-0.10 ± 1.16,表明其语音质量与多说话人TTS基线相比无显著感知差异。
- 语音模仿TTS的说话人识别准确率为60.1%,显著高于50%的随机基线,证明生成语音保留了可区分的说话人特征。
- 多说话人TTS模型的说话人识别准确率达到70.5%,反映出其在更大、更丰富的数据集上训练的优势,相较于零样本模仿方法。
- PCA可视化证实,说话人嵌入网络提取的嵌入能有效表征不同语音的潜在结构。
- 该模型可在无需微调的情况下实现实时语音模仿,适用于对输入要求极低的实时应用。
- 该方法可扩展至多模态输入(如面部视频),暗示其在情感与情境感知的文本到语音合成中具有潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。