[论文解读] Hierarchical Sequence to Sequence Voice Conversion with Limited Data
该论文提出了一种分层序列到序列语音转换模型,利用大规模单说话人TTS数据集作为预训练自编码器,以克服多说话人语音转换中的数据稀缺问题。通过使用梅尔频谱图作为输入和输出表示,结合基于注意力机制的编码器-解码器架构、分层编码以及WaveNet声码器,该方法即使在并行训练数据有限的情况下,也能实现高质量的端到端语音转换。
We present a voice conversion solution using recurrent sequence to sequence modeling for DNNs. Our solution takes advantage of recent advances in attention based modeling in the fields of Neural Machine Translation (NMT), Text-to-Speech (TTS) and Automatic Speech Recognition (ASR). The problem consists of converting between voices in a parallel setting when {\it $$} audio pairs are available. Our seq2seq architecture makes use of a hierarchical encoder to summarize input audio frames. On the decoder side, we use an attention based architecture used in recent TTS works. Since there is a dearth of large multispeaker voice conversion databases needed for training DNNs, we resort to training the network with a large single speaker dataset as an autoencoder. This is then adapted for the smaller multispeaker voice conversion datasets available for voice conversion. In contrast with other voice conversion works that use $F_0$, duration and linguistic features, our system uses mel spectrograms as the audio representation. Output mel frames are converted back to audio using a wavenet vocoder.
研究动机与目标
- 通过利用大规模单说话人TTS预训练,解决并行语音转换数据集有限的挑战。
- 开发一种端到端语音转换系统,避免对文本转录或强制对齐的需求。
- 通过使用梅尔频谱图表示和WaveNet声码器,实现在不依赖F0或时长等韵律特征情况下的高保真语音转换。
- 通过预训练自编码器的迁移学习,将模型适应到小规模多说话人语音转换数据集。
- 通过在分层编码器中学习风格不变的表示,并在解码器中注入目标说话人特征,实现说话人特定的语音转换。
提出的方法
- 使用带有CBHG(卷积银行、高速公路和门控循环单元)堆叠的分层双向GRU编码器,将输入的梅尔频谱图帧压缩为紧凑且上下文感知的表示。
- 在主编码器之前,应用带有dropout(0.5)的Prenet,随后是卷积层(核大小1–25)和最大池化,以提取分层特征。
- 采用受Tacotron启发的基于注意力机制的解码器,使用带有残差连接和dropout(0.1)的GRU层,逐帧生成目标梅尔频谱图。
- 通过最大似然估计进行模型训练,以最小化预测梅尔频谱图与目标梅尔频谱图之间的L1损失。
- 通过带有4层转置卷积上采样和空洞卷积的WaveNet声码器,将生成的梅尔频谱图转换回音频。
- 通过迁移学习实现:首先在大规模单说话人TTS数据集上以自编码器方式预训练模型,然后在小规模多说话人语音转换数据集上微调。
实验结果
研究问题
- RQ1仅使用有限的并行语音数据,基于注意力机制的分层序列到序列模型能否实现高保真语音转换?
- RQ2在大规模单说话人TTS语料上进行预训练,作为小目标数据集语音转换的自监督初始化,其有效性如何?
- RQ3与显式韵律特征(如F0、时长)相比,使用梅尔频谱图在多大程度上影响语音转换的质量和泛化能力?
- RQ4分层编码能否有效从原始梅尔频谱图序列中提取类似音素的内容表征,从而改善说话人风格的解耦?
- RQ5在梅尔频谱图条件下的WaveNet声码器能否生成在感知上自然的转换语音输出?
主要发现
- 通过利用大规模单说话人TTS数据集作为预训练源,模型实现了高质量的语音转换,有效实现了向小规模多说话人数据集的迁移学习。
- 分层编码器成功地将输入梅尔频谱图压缩为紧凑且内容感知的表示,支持解耦的说话人风格建模。
- 基于注意力机制的解码器生成的目标梅尔频谱图具有强时间连贯性,经WaveNet声码器处理后,输出语音自然流畅。
- 系统实现了端到端语音转换,无需文本转录、强制对齐或显式语言学特征,简化了整体流程。
- 超参数调优,尤其是CBHG网络容量和策略性dropout位置的选择,显著影响泛化能力并减少小数据集上的过拟合。
- 尽管未使用Postnet,模型仍能生成合理的语音转换结果,但观察到部分输出存在模糊现象,提示后处理可能带来潜在收益。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。