[论文解读] NANSY++: Unified Voice Synthesis with Neural Analysis and Synthesis
NANSY++ 提出了一种统一的、自监督的语音合成框架,将音高、振幅、语言学特征和音色等语音属性解耦为模块化的分析特征,实现了在语音转换、文本到语音合成、演唱语音合成和语音设计等任务中的高效、高质量合成。通过端到端地训练主干网络而无需成对标注数据,该方法实现了快速、数据高效且可控的生成,合成质量达到最先进水平,并具备强大的属性解耦能力。
Various applications of voice synthesis have been developed independently despite the fact that they generate "voice" as output in common. In addition, most of the voice synthesis models still require a large number of audio data paired with annotated labels (e.g., text transcription and music score) for training. To this end, we propose a unified framework of synthesizing and manipulating voice signals from analysis features, dubbed NANSY++. The backbone network of NANSY++ is trained in a self-supervised manner that does not require any annotations paired with audio. After training the backbone network, we efficiently tackle four voice applications - i.e. voice conversion, text-to-speech, singing voice synthesis, and voice designing - by partially modeling the analysis features required for each task. Extensive experiments show that the proposed framework offers competitive advantages such as controllability, data efficiency, and fast training convergence, while providing high quality synthesis. Audio samples: tinyurl.com/8tnsy3uc.
研究动机与目标
- 将语音转换、文本到语音合成、演唱语音合成和语音设计等多种语音合成应用统一到一个模块化框架下。
- 通过自监督方式训练主干网络,减少对大规模成对数据集(如文本-音频、乐谱-音频)的依赖。
- 通过将关键语音属性解耦为独立且可解释的表征,提升控制能力。
- 在保持高合成质量的同时,支持快速、模块化的微调以适应下游任务。
提出的方法
- 通过在常数Q变换(CQT)特征上使用自编码进行自监督基频(F0)估计,训练主干网络,从而无需真实基频标注。
- 采用信息扰动和瓶颈方法,从原始wav2vec风格特征中学习解耦的语言学表征。
- 引入一种与内容相关的、时变的说话人嵌入,用于建模音色,实现在推理阶段的零样本说话人适配。
- 使用基于流的归一化流架构(包含ActNorm、ShuffleLayer和AffineCouplingLayer)对基频、音色嵌入和音色标记的潜在变量进行建模。
- 在合成网络中引入人类语音产生模型的归纳偏置,以提升波形质量。
- 通过仅合成所需分析特征子集的方式支持下游任务,共享相同的主干网络和合成网络。
实验结果
研究问题
- RQ1一个单一的自监督主干网络能否有效解耦关键语音属性(音高、振幅、语言学、音色),以支持多样化的语音合成任务?
- RQ2自监督预训练在多大程度上减少了下游语音应用的数据需求并加速了微调过程?
- RQ3该模型在无成对标注的情况下,能否对解耦属性(如音高、音色、年龄/性别)实现良好控制?
- RQ4统一框架是否能在共享组件的前提下,实现语音转换、TTS、SVS和语音设计的高质量合成?
- RQ5所提出的基于流的潜在建模在语音属性编辑中(尤其是年龄和性别方面)效果如何?
主要发现
- NANSY++ 在所有四项下游任务——语音转换、文本到语音合成、演唱语音合成和语音设计中均达到最先进水平的合成质量,且无需任何成对训练数据。
- 该模型支持下游应用的快速微调,由于共享主干权重,训练收敛速度显著加快。
- 自监督基频估计方法在无需后处理或合成数据的情况下实现了高精度,且在零样本设置下优于基线方法。
- 解耦表征学习实现了对音高、振幅和音色的精确控制,定量结果表明其解耦质量优于基线方法。
- 在NANSY-VOD中,考虑到年龄与性别感知之间的非线性关系,年龄/性别编辑算法在儿童到成人语音转换任务中性能提升了8倍。
- SPNet在性别分类任务中达到93.75%的准确率,在年龄估计任务中平均绝对误差为4.095,能够为语音编辑提供可靠的说话人属性条件控制。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。