Skip to main content
QUICK REVIEW

[论文解读] Voice Conversion using Convolutional Neural Networks

Shariq Mobin, Joan Bruna|arXiv (Cornell University)|Oct 27, 2016
Music and Audio Processing参考文献 2被引用 5
一句话总结

本文提出一种基于条件生成对抗网络(cGAN)的语音转换方法,结合深度视觉类比网络(VAN)与恒定Q变换(CQT)特征,实现说话人音色与语言内容的解耦。该模型能够学习在保留语音内容的同时转移音色,实现感知上合理的语音转换,但因解码阶段的上采样导致频率分辨率仍受限。

ABSTRACT

The human auditory system is able to distinguish the vocal source of thousands of speakers, yet not much is known about what features the auditory system uses to do this. Fourier Transforms are capable of capturing the pitch and harmonic structure of the speaker but this alone proves insufficient at identifying speakers uniquely. The remaining structure, often referred to as timbre, is critical to identifying speakers but we understood little about it. In this paper we use recent advances in neural networks in order to manipulate the voice of one speaker into another by transforming not only the pitch of the speaker, but the timbre. We review generative models built with neural networks as well as architectures for creating neural networks that learn analogies. Our preliminary results converting voices from one speaker to another are encouraging.

研究动机与目标

  • 开发一种基于神经网络的语音转换方法,以实现说话人身份(音色)与语言内容的解耦。
  • 探究神经网络是否能够学习音色迁移的变换算子,从而避免依赖人工设计的听觉模型。
  • 通过端到端学习替代手工设计的特征,改进先前工作中的音色插值方法。
  • 探究条件GAN在建模特定说话人语音特征的同时保持语音身份可行性的能力。

提出的方法

  • 模型使用恒定Q变换(CQT)将原始音频转换为对数频率表示,以模拟人类听觉处理机制。
  • 采用深度视觉类比网络(VAN)作为生成器,学习一种类比映射关系:'源说话人的语音之于目标说话人的语音,如同输入语音之于输出语音'。
  • 生成器在条件生成对抗网络(cGAN)框架中进行训练,判别器根据说话人和语音内容身份对真实与生成的CQT特征进行分类。
  • 目标函数最小化对抗损失,同时鼓励生成器输出与真实数据在说话人和语音内容类别上匹配的CQT特征。
  • 训练过程中采用偏差采样策略,其中一半批次样本来自生成器,以提升对虚假说话人和语音的判别能力。
  • 模型通过学习音色与内容的解耦表示,实现对不同说话人所发音的同一词语的重建。

实验结果

研究问题

  • RQ1深度神经网络能否在保留所发音内容的同时,实现从一个说话人到另一个说话人的音色迁移?
  • RQ2基于VAN的条件GAN在多大程度上能重建感知上合理的语音转换?
  • RQ3与原始波形或标准傅里叶变换相比,使用CQT特征在多大程度上提升了音色解耦效果?
  • RQ4当前方法在频谱分辨率和感知质量方面存在哪些局限性?
  • RQ5VAN与GAN架构的结合在将语音转换建模为解耦问题方面有多高效?

主要发现

  • 该模型成功实现了从一个说话人到另一个说话人的音色迁移,同时保留了所发音的内容,生成了感知上合理的语音转换结果。
  • 生成的音频较好地捕捉了目标说话人的谐波结构,表明对频谱包络和音高特征的学习效果良好。
  • 生成信号的频率分辨率有限,可能源于解码阶段的上采样操作。
  • 即使在仅包含一个说话人和四个词语的小型训练集上,模型也表现出良好性能,表明在更多数据下具备良好的泛化潜力。
  • 音频样本显示,模型能够生成与目标说话人感知相似的语音,尽管并非总是无法区分。
  • 条件GAN的训练仍具挑战性,作者指出需进一步优化以实现更稳定和高质量的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。