[论文解读] Generative Adversarial Networks for Unpaired Voice Transformation on Impaired Speech
该论文提出了一种新颖的基于生成对抗网络(GAN)的端到端无监督语音转换模型,可将受损语音转换为更清晰、更易懂的正常语音,且无需并行训练数据。该方法通过控制器将受损语音映射为内容语音码,生成器利用该码合成自然且保留说话人特征的语音,在语音清晰度和说话人特征保留方面优于CycleGAN。
This paper focuses on using voice conversion (VC) to improve the speech intelligibility of surgical patients who have had parts of their articulators removed. Due to the difficulty of data collection, VC without parallel data is highly desired. Although techniques for unparallel VC, for example, CycleGAN, have been developed, they usually focus on transforming the speaker identity, and directly transforming the speech of one speaker to that of another speaker and as such do not address the task here. In this paper, we propose a new approach for unparallel VC. The proposed approach transforms impaired speech to normal speech while preserving the linguistic content and speaker characteristics. To our knowledge, this is the first end-to-end GAN-based unsupervised VC model applied to impaired speech. The experimental results show that the proposed approach outperforms CycleGAN.
研究动机与目标
- 解决因切除言语器官而导致言语清晰度受损的外科患者言语清晰度提升问题。
- 通过实现无监督、非配对的语音转换,克服配对训练数据(受损语音与正常语音)稀缺的问题。
- 在转换过程中同时保留语言内容和说话人特异性特征,以维持说话人身份和自然性。
- 开发一种方法,使其在保留说话人身份和改善发音清晰度方面优于现有的基于GAN的方法(如CycleGAN)。
提出的方法
- 采用三部分架构:生成器G、判别器D和控制器C,在对抗性框架中端到端训练。
- 生成器G从内容码c生成正常语音,判别器D用于区分真实正常语音与生成样本。
- 控制器C将输入的受损语音映射为内容码c,该码由G用于生成保留语言和说话人特征的正常语音。
- 采用基于感知的损失,利用判别器的隐藏层评估受损语音与生成语音之间的高层相似性,替代低层次信号差异。
- 在大规模正常语音数据集上训练生成器和判别器,而控制器则仅在受损语音上进行训练,以最小化高层差异。
- 采用改进的对抗性损失,引入控制器损失,以促使控制器生成的内容码所生成的输出在内容和说话人身份方面与真实正常语音难以区分。
实验结果
研究问题
- RQ1基于GAN的非配对语音转换模型是否能有效提升受损语音的语音清晰度,且无需并行训练数据?
- RQ2所提出的模型在转换过程中对受损语音的语言内容和说话人身份的保留效果如何?
- RQ3与循环一致性损失相比,使用基于感知的损失(通过判别器特征实现)在保持内容和说话人一致性方面有何影响?
- RQ4为何CycleGAN在此类特定受损语音场景下无法保留说话人身份和语言内容?
- RQ5基于控制器的架构与生成器和控制器联合训练相比,在训练稳定性和音频质量方面表现如何?
主要发现
- 所提模型在发音清晰度方面的平均意见得分(MOS)达到59.4%,显著优于CycleGAN(33.2%)和cGAN(41.4%),表明其在提升语音清晰度方面表现更优。
- 说话人特征的相似性MOS为56.4%,语言内容的MOS为60.2%,均显著高于CycleGAN的32.4%和37.4%,证明其在保留说话人身份和内容方面表现更佳。
- 消融研究显示,若移除判别器的增强输入(NoSD),控制器和判别器损失均升高,表明生成器质量下降且频谱图更模糊。
- 生成器与控制器的联合训练(C&G)导致判别器损失迅速降至零,表明生成器质量差,无法生成逼真输出。
- CycleGAN表现出隐写特性——在目标域中保留原始输入信息,导致循环回溯时重建保真度极高,从而破坏了内容和说话人一致性。
- 控制器通过判别器特征实现的高层相似性,成功最小化了受损语音与生成语音在感知相关维度上的差异,而循环一致性损失则无法有效强制内容和说话人保留。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。