[论文解读] Efficient Non-Autoregressive GAN Voice Conversion using VQWav2vec Features and Dynamic Convolution
该论文提出 DYGAN-VC,一种基于非自回归 GAN 的语音转换模型,利用 VQWav2vec 嵌入实现高效语音表征,并采用动态卷积实现轻量化、高性能的内容建模。该模型仅使用 700 万参数(为级联 ASR-TTS 模型的一半),实现高达 8 倍的推理加速,在 VCC2020 上取得 3.86 的 MOS 分数,且仅 4.3% 的 CER。
It was shown recently that a combination of ASR and TTS models yield highly competitive performance on standard voice conversion tasks such as the Voice Conversion Challenge 2020 (VCC2020). To obtain good performance both models require pretraining on large amounts of data, thereby obtaining large models that are potentially inefficient in use. In this work we present a model that is significantly smaller and thereby faster in processing while obtaining equivalent performance. To achieve this the proposed model, Dynamic-GAN-VC (DYGAN-VC), uses a non-autoregressive structure and makes use of vector quantised embeddings obtained from a VQWav2vec model. Furthermore dynamic convolution is introduced to improve speech content modeling while requiring a small number of parameters. Objective and subjective evaluation was performed using the VCC2020 task, yielding MOS scores of up to 3.86, and character error rates as low as 4.3\%. This was achieved with approximately half the number of model parameters, and up to 8 times faster decoding speed.
研究动机与目标
- 为解决大型自回归 ASR-TTS 模型在语音转换中效率低下的问题,这些模型需要大量内存和计算资源。
- 在不牺牲语音质量或转换准确率的前提下,提升模型效率。
- 探索在 GAN 基础的语音转换框架中,自监督 VQWav2vec 特征与动态卷积的集成效果。
- 实现参数量更少、推理速度更快的多对多语音转换。
提出的方法
- 使用 VQWav2vec(一种自监督语音表征模型),从原始音频中提取轻量化、与说话人无关的嵌入。
- 采用非自回归生成器网络,实现快速并行推理,显著降低解码时间。
- 引入动态卷积作为自注意力机制的参数高效替代方案,通过输入特征生成卷积核权重。
- 应用 WadaIN(加权 AdaIN)进行风格调制,实现有效的说话人嵌入条件控制。
- 利用 GAN 判别器提升生成波形的语音质量和真实感。
- 采用 Parallel WaveGAN 作为声码器,从梅尔频谱图重建高保真波形。
实验结果
研究问题
- RQ1非自回归 GAN 基础的语音转换模型是否能在参数量显著减少且推理速度大幅提升的前提下,实现与自回归 ASR-TTS 模型相当的性能?
- RQ2在语音转换中,VQWav2vec 嵌入在内容和说话人表征方面,替代 ASR 模型的效果如何?
- RQ3与标准卷积或自注意力层相比,动态卷积在语音转换中对建模效率和性能的提升程度如何?
- RQ4VQWav2vec 与动态卷积的结合是否能实现高质量的多对多语音转换,同时保持极低的参数开销?
主要发现
- DYGAN-VC 在 VCC2020 基准测试中取得 3.86 的平均意见得分(MOS),与 SOTA 级联 ASR-TTS 模型(3.81)非常接近。
- 模型将字符错误率(CER)降低至最低 4.3%,表明其在转换过程中具有极强的语言保真度。
- 在 CPU 上的解码速度达到 5.4 RTF,比基线级联 ASR-TTS 模型(46.1 RTF)快 8.5 倍。
- 生成器仅使用 700 万个参数,使总模型大小约为 1.05 亿参数的级联 ASR-TTS 模型的一半。
- 消融实验证实,动态卷积与 WadaIN 的组合在 MCD、CER 和 WER 指标上均取得最佳性能。
- 主观评估显示,DYGAN-VC 在除 F-M 方向外的所有方向上均优于基线模型的说话人相似度,同时保持了几乎相等的自然度评分。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。