Skip to main content
QUICK REVIEW

[论文解读] Attention-Guided Generative Adversarial Network for Whisper to Normal Speech Conversion

Teng Gao, Jian Zhou|arXiv (Cornell University)|Nov 2, 2021
Speech and Audio Processing参考文献 25被引用 4
一句话总结

本文提出一种注意力引导的生成对抗网络(AGAN-W2SC),用于无需基频估计和动态时间规整(DTW)对齐的语音转写语音转换。该方法通过自注意力机制实现在帧级别的自适应时间对齐,实现了更优的语音质量和可懂度,P.563得分为1.872,优于基于DTW的基线模型(如GMM、BLSTM和Cycle-GAN)。

ABSTRACT

Whispered speech is a special way of pronunciation without using vocal cord vibration. A whispered speech does not contain a fundamental frequency, and its energy is about 20dB lower than that of a normal speech. Converting a whispered speech into a normal speech can improve speech quality and intelligibility. In this paper, a novel attention-guided generative adversarial network model incorporating an autoencoder, a Siamese neural network, and an identity mapping loss function for whisper to normal speech conversion (AGAN-W2SC) is proposed. The proposed method avoids the challenge of estimating the fundamental frequency of the normal voiced speech converted from a whispered speech. Specifically, the proposed model is more amendable to practical applications because it does not need to align speech features for training. Experimental results demonstrate that the proposed AGAN-W2SC can obtain improved speech quality and intelligibility compared with dynamic-time-warping-based methods.

研究动机与目标

  • 解决在不依赖显式基频(F0)估计的情况下,将耳语语音转换为正常语音的挑战。
  • 通过自注意力机制实现帧级别的自适应时间对齐,消除训练数据中对动态时间规整(DTW)对齐的需求。
  • 通过学习从耳语语音频谱到正常语音频谱的鲁棒映射,提升语音转换中的语音质量和可懂度。
  • 开发一种灵活的端到端深度学习模型,直接在梅尔频谱图上运行,无需多参数特征映射或强制时长对齐。

提出的方法

  • 模型采用生成对抗网络(GAN)框架,包含类似U-Net的编码器-解码器生成器和基于局部感受野的判别器,用于对抗性训练。
  • 在编码器中集成自注意力模块,以自适应地加权局部频谱特征,实现耳语与正常语音帧之间的隐式时间对齐。
  • 采用自编码器组件以在转换过程中保留内容信息,提升重建保真度。
  • 使用孪生神经网络比较耳语和正常语音的嵌入特征,辅助判别性表征学习。
  • 应用身份映射损失以在转换过程中保留原始语音内容,减少失真。
  • 生成器与判别器的训练比例为3:1,学习率设定在0.0001至0.0002之间,以确保稳定收敛。

实验结果

研究问题

  • RQ1深度学习模型能否在不依赖显式基频估计的情况下,实现耳语语音到正常语音的转换?
  • RQ2自注意力机制是否能有效替代动态时间规整(DTW)在耳语转正常语音转换中的时间对齐功能?
  • RQ3基于端到端生成对抗网络、帧级别训练的方法是否在语音质量和可懂度上优于传统基于DTW对齐的方法?
  • RQ4尽管耳语中缺乏声带激励信号,该模型能否生成感知自然、F0轮廓表现良好的语音?

主要发现

  • 所提出的AGAN-W2SC模型取得P.563得分为1.872,显著优于基线模型(如GMM得分为1.163,BLSTM得分为1.247,Cycle-GAN得分为1.107),表明其在客观语音质量方面表现更优。
  • AGAN-W2SC生成的转换语音的F0轮廓与参考正常语音高度一致,证明了其在隐式F0生成方面的有效性。
  • 转换语音与参考语音之间的基频均方根误差(RMSE)与基线方法相当或更优,且在去除静音帧后,处理后的F0 RMSE表现出更强的鲁棒性。
  • 主观感知评价显示,AGAN-W2SC生成的语音更平滑、更自然,尽管其RMSE并非始终最低。
  • 该模型在帧级别运行,无需固定长度输入,因此更具灵活性,适用于不同时长的耳语与正常语音配对。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。