[论文解读] ConVoice: Real-Time Zero-Shot Voice Style Transfer with Convolutional Network
ConVoice 提出了一种轻量级、全卷积、非自回归神经网络,用于使用预训练的自动语音识别(ASR)和说话人嵌入模型实现实时零样本语音风格迁移。它实现了快速推理(在单张 V100 GPU 上为 321.58 RTF),且无需并行或转录数据即可实现高质量语音合成,仅需几秒钟目标说话人语音即可实现零样本转换。
We propose a neural network for zero-shot voice conversion (VC) without any parallel or transcribed data. Our approach uses pre-trained models for automatic speech recognition (ASR) and speaker embedding, obtained from a speaker verification task. Our model is fully convolutional and non-autoregressive except for a small pre-trained recurrent neural network for speaker encoding. ConVoice can convert speech of any length without compromising quality due to its convolutional architecture. Our model has comparable quality to similar state-of-the-art models while being extremely fast.
研究动机与目标
- 解决无需并行或转录训练数据的零样本语音转换挑战。
- 实现在任意长度语音输入上的快速、实时推理。
- 在保持高语音质量和说话人相似度的同时,减少模型大小和计算成本。
- 仅需几秒钟目标说话人语音即可实现零样本推理,避免数据收集或微调。
- 开发一种紧凑的全卷积架构,避免自回归生成以提升速度。
提出的方法
- 利用预训练的 QuartzNet-5x5 ASR 模型从源语音中提取语言特征。
- 使用基于 RNN 的预训练说话人编码器(来自说话人验证任务)从目标说话人的语音中提取固定维度的说话人嵌入。
- 使用全卷积解码器,基于源语音的声学特征和目标说话人嵌入生成梅尔频谱图。
- 应用非自回归 WaveGlow vocoder,从预测的梅尔频谱图合成原始音频。
- 利用预训练 ASR 模型中间层激活作为内容表征,避免对转录数据的依赖。
- 通过仅使用少量目标说话人语音的嵌入条件化解码器,实现对未见说话人的零样本推理。
实验结果
研究问题
- RQ1非自回归、全卷积模型能否在无需并行或转录数据的情况下实现高质量的零样本语音转换?
- RQ2与最先进方法相比,所提出的 ConVoice 模型在语音自然度和说话人相似度方面的表现如何?
- RQ3当处理长语音输入时,模型在质量和速度方面保持怎样的性能?
- RQ4在仅使用极少目标说话人数据的零样本设置下,模型的有效性如何?
- RQ5声码器选择对整体推理速度和质量有何影响?
主要发现
- 在单张 V100 GPU 上,批量大小为 1 时,ConVoice 的推理延迟为 0.011 秒(RTF 为 321.58),在不包含声码器的情况下即实现实时性能。
- 模型生成的语音质量高,在微调设置下自然度 MOS 为 3.30,说话人相似度 MOS 为 3.30/3.39(Hub/Spoke),与最先进模型 N10 相当。
- 零样本 ConVoice 的说话人相似度 MOS 为 2.93(Hub)和 2.88(Spoke),经微调后显著提升,几乎消除了背景噪声。
- 模型体积紧凑(不含声码器为 11M 参数),支持快速可扩展的推理,且在处理任意长度输入时不会造成质量下降。
- 利用预训练的 ASR 和说话人模型,无需并行数据或大量微调,即可实现真正的零样本转换,仅需几秒钟目标说话人语音。
- 若将 WaveGlow 替换为更高效的声码器(如 WaveFlow 或 SqueezeWave),可进一步提升端到端推理速度,同时保持语音质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。