[论文解读] Joint training framework for text-to-speech and voice conversion using multi-source Tacotron and WaveNet
本文提出一种联合训练框架,采用多源Tacotron与双注意力机制结合WaveNet,将文本到语音(TTS)和语音转换(VC)统一于单一共享模型中。该模型以文本或源说话人语谱图为输入,通过WaveNet生成高质量语音,在两项任务中均取得具有竞争力的表现,且VC性能优于独立模型。
We investigated the training of a shared model for both text-to-speech (TTS) and voice conversion (VC) tasks. We propose using an extended model architecture of Tacotron, that is a multi-source sequence-to-sequence model with a dual attention mechanism as the shared model for both the TTS and VC tasks. This model can accomplish these two different tasks respectively according to the type of input. An end-to-end speech synthesis task is conducted when the model is given text as the input while a sequence-to-sequence voice conversion task is conducted when it is given the speech of a source speaker as the input. Waveform signals are generated by using WaveNet, which is conditioned by using a predicted mel-spectrogram. We propose jointly training a shared model as a decoder for a target speaker that supports multiple sources. Listening experiments show that our proposed multi-source encoder-decoder model can efficiently achieve both the TTS and VC tasks.
研究动机与目标
- 将文本到语音(TTS)与语音转换(VC)统一为单一共享的深度学习模型。
- 通过单一架构同时执行TTS与VC任务,减少对特定任务模型设计与重新训练的需求。
- 通过联合训练实现共享表征学习与数据效率,提升VC性能。
- 探究由于共享架构与特征工程趋势的发展,TTS与VC之间的理论差异是否已减弱。
提出的方法
- 采用多源序列到序列模型,结合双注意力机制,其中两个编码器分别处理文本或源说话人语谱图,共享解码器预测梅尔语谱图。
- 模型基于Tacotron架构设计共享解码器,包含预网络、CBHG模块以及基于注意力的RNN,用于序列建模。
- 使用WaveNet作为声码器,基于预测的梅尔语谱图生成16 kHz采样率、μ-law量化格式的原始音频波形。
- 通过混合TTS与VC数据联合训练模型,并引入掩码机制在训练过程中选择合适的输入源。
- 利用预训练的TTS模型进行微调,以实现目标说话人适应,提升小样本条件下的TTS性能。
- WaveNet声码器采用30层扩张卷积层,采用指数级扩张与跳跃连接,以建模高保真波形。
实验结果
研究问题
- RQ1单一深度学习模型能否有效同时执行文本到语音合成与语音转换任务?
- RQ2与分别训练相比,TTS与VC的联合训练是否能提升两项任务的性能?
- RQ3多源编码器-解码器架构结合双注意力机制,如何影响模型在TTS与VC输入间泛化的能力?
- RQ4共享表征学习对VC质量有何影响,特别是在使用非平行数据时?
- RQ5共享模型能否在保持竞争力TTS质量的同时,进一步提升VC性能?
主要发现
- 所提出的联合模型成功使用同一架构同时执行TTS与VC任务,输入类型决定具体任务。
- 混合VC系统在语音质量与说话人相似度方面均优于独立VC模型,MOS评分更高。
- 混合系统在说话人相似度的MOS评分显著高于独立VC模型,表明说话人迁移能力得到提升。
- 混合模型的TTS性能低于独立TTS系统,表明可能存在对VC任务的过拟合,或TTS能力不足。
- 结果表明联合训练可提升VC性能,但需进一步调整网络架构以平衡TTS与VC表现。
- 利用预训练TTS模型进行目标说话人适应,有助于在数据有限条件下提升TTS质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。