[论文解读] VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion
该论文提出VQMIVC,一种无监督的单次语音转换方法,通过向量量化(VQCPC)与互信息(MI)最小化来解耦语音表征,以减少内容、说话人和音高因子之间的相互依赖。通过联合优化重建、VQCPC和MI损失,该模型在保持语言内容和语调的同时,实现了更自然的语音和更高的说话人相似度,优于最先进方法,在客观与主观评估中表现更优。
One-shot voice conversion (VC), which performs conversion across arbitrary speakers with only a single target-speaker utterance for reference, can be effectively achieved by speech representation disentanglement. Existing work generally ignores the correlation between different speech representations during training, which causes leakage of content information into the speaker representation and thus degrades VC performance. To alleviate this issue, we employ vector quantization (VQ) for content encoding and introduce mutual information (MI) as the correlation metric during training, to achieve proper disentanglement of content, speaker and pitch representations, by reducing their inter-dependencies in an unsupervised manner. Experimental results reflect the superiority of the proposed method in learning effective disentangled speech representations for retaining source linguistic content and intonation variations, while capturing target speaker characteristics. In doing so, the proposed approach achieves higher speech naturalness and speaker similarity than current state-of-the-art one-shot VC systems. Our code, pre-trained models and demo are available at https://github.com/Wendison/VQMIVC.
研究动机与目标
- 为解决单次语音转换中语音表征间的信息泄露问题,特别是内容信息污染说话人嵌入的问题。
- 在无需任何监督信息(如文本转录或说话人标签)的情况下,实现内容、说话人和音高因子的有效解耦。
- 通过训练过程中最小化解耦表征之间的互信息,提升语音转换质量。
- 通过保留语言内容和源语音语调,实现高质量的单次语音转换,同时准确迁移目标说话人特征。
提出的方法
- 系统采用基于向量量化与对比预测编码(VQCPC)的内容编码器,提取帧级语言内容表征。
- 说话人编码器从原始声学特征生成固定维数的向量表征,以捕捉说话人身份。
- 音高提取器在话语级别计算归一化的基频(F₀),以保留语调变化。
- 解码器从解耦的内容、说话人和音高表征中重建梅尔频谱图。
- 模型采用三种损失组件进行训练:重建损失、用于建模局部语音结构的VQCPC损失,以及用于最小化表征间依赖关系的互信息(MI)损失。
- 通过变分对比对数似然比上界(vCLUB)最小化互信息,以无监督方式强制实现解耦。
实验结果
研究问题
- RQ1互信息最小化是否能有效降低单次语音转换中内容、说话人和音高表征之间的相互依赖?
- RQ2通过VQCPC与MI实现的无监督解耦,如何提升单次VC中的内容保留与语调一致性?
- RQ3与现有无监督解耦方法相比,基于MI的正则化在多大程度上缓解了信息泄露?
- RQ4引入音高表征是否能增强转换过程中源语音语调的保留?
- RQ5在语音自然度与说话人相似度方面,所提方法与最先进单次VC系统相比表现如何?
主要发现
- 所提VQMIVC方法在转换语音上达到最低的词错误率(WER)29.3%与字符错误率(CER)14.9%,显著优于AutoVC、AdaIN-VC与VQVC+。
- 源语音与转换后F₀波形之间的皮尔逊相关系数(PCC)达0.781,表明语调变化得到良好保留。
- 在无互信息正则化(w/o MI)条件下,WER上升至62.1%,CER上升至38.0%,表明MI最小化对防止内容信息泄露至说话人表征中至关重要。
- 主观MOS评估显示,所提方法在语音自然度(平均分4.2)与说话人相似度(平均分4.3)方面优于AutoVC与VQVC+,且更接近理想性能。
- 消融实验验证,MI正则化可降低表征相关性,从而实现更精确的解耦与更高的VC质量。
- 系统在多种说话人配对中保持高性能,证实其在零样本与单次设置下的鲁棒性,且无需说话人标签或转录文本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。