Skip to main content
QUICK REVIEW

[论文解读] VoiceLoop: Voice Fitting and Synthesis via a Phonological Loop

Yaniv Taigman, Lior Wolf|arXiv (Cornell University)|Jul 20, 2017
Speech Recognition and Synthesis参考文献 20被引用 13
一句话总结

VoiceLoop 引入了一种新颖的神经文本转语音系统,能够从不受约束、真实环境中的语音样本中合成自然语音,而无需音素对齐或语言学特征。它采用受语音环路启发的共享、可移动的缓冲内存,以维持长期依赖关系,从而在极少量数据下实现稳健的语音拟合与合成,并支持仅用少量音频样本进行新说话人的微调。

ABSTRACT

We present a new neural text to speech (TTS) method that is able to transform text to speech in voices that are sampled in the wild. Unlike other systems, our solution is able to deal with unconstrained voice samples and without requiring aligned phonemes or linguistic features. The network architecture is simpler than those in the existing literature and is based on a novel shifting buffer working memory. The same buffer is used for estimating the attention, computing the output audio, and for updating the buffer itself. The input sentence is encoded using a context-free lookup table that contains one entry per character or phoneme. The speakers are similarly represented by a short vector that can also be fitted to new identities, even with only a few samples. Variability in the generated speech is achieved by priming the buffer prior to generating the audio. Experimental results on several datasets demonstrate convincing capabilities, making TTS accessible to a wider range of applications. In order to promote reproducibility, we release our source code and models.

研究动机与目标

  • 从不受约束的真实语音样本(如 YouTube 演讲)中实现文本转语音合成,即使存在背景噪声、鼓掌声和较差的音频质量。
  • 在文本转语音训练和推理过程中,消除对音素-声学数据对齐或显式语言学特征的需求。
  • 仅使用少量短音频片段,在训练后实现对新说话人的语音拟合。
  • 开发一种轻量化、高效的架构,适用于移动设备上的实时推理。

提出的方法

  • 使用一个移动缓冲内存矩阵 S ∈ ℝ^d×k 作为动态工作内存,其中每一列在每个时间步向右移动,同时在前端插入一个新的表示向量 u。
  • 表示向量 u 通过一个浅层全连接网络计算得出,其输入包括说话人嵌入、当前注意力上下文、前一输出以及整个缓冲区状态。
  • 注意力机制使用 Graves 的单调注意力,从音素嵌入计算上下文向量,确保顺序的、从左到右的处理流程。
  • 输出音频由一个独立的浅层网络生成,该网络以缓冲区状态和说话人嵌入作为输入,实现直接、个性化的合成。
  • 说话人身份通过一个可学习的嵌入向量建模,该向量可在训练后使用极少数据进行微调或拟合至新身份。
  • 通过使用先前词语的上下文向量初始化缓冲区,实现预热(priming),从而生成多样的语调,使同一输入文本可产生多种语调变化。

实验结果

研究问题

  • RQ1神经文本转语音系统是否能在无需音素对齐或语言学特征的情况下,从不受约束的真实环境语音样本中实现高质量语音合成?
  • RQ2与 RNN 相比,共享的可移动缓冲内存机制在建模语音合成中的长期依赖关系方面效果如何?
  • RQ3该模型是否能仅使用少量短音频片段就泛化到新说话人,而无需重新训练?
  • RQ4受语音环路启发的记忆架构在提升对噪声和非理想录音条件的鲁棒性方面,改善程度如何?
  • RQ5通过预热缓冲区能否从同一文本输入生成多样的语调变化(例如不同语调)?

主要发现

  • VoiceLoop 在真实 YouTube 数据集上取得了 2.97 ± 1.03 的平均意见得分(MOS),表明尽管训练数据存在噪声且未对齐,其语音质量仍具有可接受的感知水平。
  • 说话人识别网络在合成语音上的 top-1 准确率达到 95.81%,表明合成语音与目标说话人身份高度匹配。
  • 与基线模型 Char2Wav 不同,该模型成功避免了合成背景噪声(如鼓掌声和笑声),未复制此类伪影。
  • 使用不同词语(如 'I'、'had'、'must'、'bye')对缓冲区进行预热,产生了不同的语调模式,包括基频(F0)和音素时长的变化,经频谱图和 F0 分析确认。
  • 该系统在 CPU 上实现了超过 2.7× 实时的推理速度,证明其计算效率高,适合移动端部署。
  • 即使仅使用几秒钟的音频,训练后说话人拟合也十分有效,实现了极小数据量下的零样本语音克隆。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。