[论文解读] Attention-Guided Generative Adversarial Network for Whisper to Normal Speech Conversion
本文提出一种注意力引导的生成对抗网络(AGAN-W2SC),用于无需基频估计和动态时间规整(DTW)对齐的语音转写语音转换。该方法通过自注意力机制实现在帧级别的自适应时间对齐,实现了更优的语音质量和可懂度,P.563得分为1.872,优于基于DTW的基线模型(如GMM、BLSTM和Cycle-GAN)。
Whispered speech is a special way of pronunciation without using vocal cord vibration. A whispered speech does not contain a fundamental frequency, and its energy is about 20dB lower than that of a normal speech. Converting a whispered speech into a normal speech can improve speech quality and intelligibility. In this paper, a novel attention-guided generative adversarial network model incorporating an autoencoder, a Siamese neural network, and an identity mapping loss function for whisper to normal speech conversion (AGAN-W2SC) is proposed. The proposed method avoids the challenge of estimating the fundamental frequency of the normal voiced speech converted from a whispered speech. Specifically, the proposed model is more amendable to practical applications because it does not need to align speech features for training. Experimental results demonstrate that the proposed AGAN-W2SC can obtain improved speech quality and intelligibility compared with dynamic-time-warping-based methods.
研究动机与目标
- 解决在不依赖显式基频(F0)估计的情况下,将耳语语音转换为正常语音的挑战。
- 通过自注意力机制实现帧级别的自适应时间对齐,消除训练数据中对动态时间规整(DTW)对齐的需求。
- 通过学习从耳语语音频谱到正常语音频谱的鲁棒映射,提升语音转换中的语音质量和可懂度。
- 开发一种灵活的端到端深度学习模型,直接在梅尔频谱图上运行,无需多参数特征映射或强制时长对齐。
提出的方法
- 模型采用生成对抗网络(GAN)框架,包含类似U-Net的编码器-解码器生成器和基于局部感受野的判别器,用于对抗性训练。
- 在编码器中集成自注意力模块,以自适应地加权局部频谱特征,实现耳语与正常语音帧之间的隐式时间对齐。
- 采用自编码器组件以在转换过程中保留内容信息,提升重建保真度。
- 使用孪生神经网络比较耳语和正常语音的嵌入特征,辅助判别性表征学习。
- 应用身份映射损失以在转换过程中保留原始语音内容,减少失真。
- 生成器与判别器的训练比例为3:1,学习率设定在0.0001至0.0002之间,以确保稳定收敛。
实验结果
研究问题
- RQ1深度学习模型能否在不依赖显式基频估计的情况下,实现耳语语音到正常语音的转换?
- RQ2自注意力机制是否能有效替代动态时间规整(DTW)在耳语转正常语音转换中的时间对齐功能?
- RQ3基于端到端生成对抗网络、帧级别训练的方法是否在语音质量和可懂度上优于传统基于DTW对齐的方法?
- RQ4尽管耳语中缺乏声带激励信号,该模型能否生成感知自然、F0轮廓表现良好的语音?
主要发现
- 所提出的AGAN-W2SC模型取得P.563得分为1.872,显著优于基线模型(如GMM得分为1.163,BLSTM得分为1.247,Cycle-GAN得分为1.107),表明其在客观语音质量方面表现更优。
- AGAN-W2SC生成的转换语音的F0轮廓与参考正常语音高度一致,证明了其在隐式F0生成方面的有效性。
- 转换语音与参考语音之间的基频均方根误差(RMSE)与基线方法相当或更优,且在去除静音帧后,处理后的F0 RMSE表现出更强的鲁棒性。
- 主观感知评价显示,AGAN-W2SC生成的语音更平滑、更自然,尽管其RMSE并非始终最低。
- 该模型在帧级别运行,无需固定长度输入,因此更具灵活性,适用于不同时长的耳语与正常语音配对。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。