[论文解读] Image to Image Translation based on Convolutional Neural Network Approach for Speech Declipping
本文提出了一种基于U-Net的卷积神经网络,通过将削波语音的幅度谱图视为图像,并使用图像到图像翻译技术将其转换为干净语音的谱图,从而实现语音去削波。该方法在语音质量与可懂度方面表现优异,尤其在严重削波和噪声环境下优于现有方法。
Clipping, as a current nonlinear distortion, often occurs due to the limited dynamic range of audio recorders. It degrades the speech quality and intelligibility and adversely affects the performances of speech and speaker recognitions. In this paper, we focus on enhancement of clipped speech by using a fully convolutional neural network as U-Net. Motivated by the idea of image-to-image translation, we propose a declipping approach, namely U-Net declipper in which the magnitude spectrum images of clipped signals are translated to the corresponding images of clean ones. The experimental results show that the proposed approach outperforms other declipping methods in terms of both quality and intelligibility measures, especially in severe clipping cases. Moreover, the superior performance of the U-Net declipper over the well-known declipping methods is verified in additive Gaussian noise conditions.
研究动机与目标
- 解决由于音频录音设备动态范围受限导致的语音质量与可懂度下降问题。
- 开发一种基于深度学习的有效方法,用于恢复削波语音信号。
- 利用计算机视觉中图像到图像翻译的成功经验,应用于语音增强任务。
- 在干净与噪声环境下均提升性能,尤其在严重削波条件下。
提出的方法
- 该方法采用全卷积的U-Net架构,端到端学习从削波语音谱图到干净语音谱图的映射。
- 将削波语音的幅度谱图作为输入图像,重建的干净谱图作为输出图像。
- 通过对抗性损失与L1损失的组合进行训练,以保留结构细节并最小化重建误差。
- 使用Adam优化器和学习率调度策略,通过反向传播进行模型优化。
- 在具有不同程度削波严重性的真实世界削波语音数据上进行训练与评估。
- 在添加高斯噪声的测试条件下,验证了该方法对噪声的鲁棒性。
实验结果
研究问题
- RQ1使用U-Net架构进行图像到图像翻译能否有效恢复削波语音信号?
- RQ2所提出的去削波方法在语音质量与可懂度方面与现有方法相比表现如何?
- RQ3该方法在严重削波及存在附加噪声的情况下是否仍能保持性能?
- RQ4该模型能否在不同削波水平和语音内容上实现良好泛化?
主要发现
- U-Net去削波器在客观质量指标(如PESQ、STOI)和可懂度测量中均优于现有去削波方法。
- 在传统方法失效的严重削波情况下,该方法表现出显著改进。
- 在添加高斯噪声条件下,U-Net去削波器相比基线方法保持了更优性能。
- 对抗性损失与L1损失的结合带来了更高的主观感知质量与更优的频谱重建效果。
- 该模型在不同语音信号与削波水平间表现出良好泛化能力,展现出强鲁棒性。
- 该方法在发表时达到当时最先进水平,已在ETECH 2019会议得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。