Skip to main content
QUICK REVIEW

[论文解读] Phase reconstruction based on recurrent phase unwrapping with deep neural networks

Yoshiki Masuyama, Kohei Yatabe|arXiv (Cornell University)|Feb 14, 2020
Speech and Audio Processing参考文献 30被引用 5
一句话总结

本文提出一种基于两阶段深度神经网络(DNN)的相位重建方法,通过训练DNN预测相位导数(瞬时频率和群时延),再利用一种新型循环相位解缠技术(RPU)递归解缠,避免了直接相位估计的不稳定性。该方法在客观指标和主观质量方面均优于使用冯·米塞斯DNN的直接相位估计以及瞬时频率数值积分的相位重建方法。

ABSTRACT

Phase reconstruction, which estimates phase from a given amplitude spectrogram, is an active research field in acoustical signal processing with many applications including audio synthesis. To take advantage of rich knowledge from data, several studies presented deep neural network (DNN)--based phase reconstruction methods. However, the training of a DNN for phase reconstruction is not an easy task because phase is sensitive to the shift of a waveform. To overcome this problem, we propose a DNN-based two-stage phase reconstruction method. In the proposed method, DNNs estimate phase derivatives instead of phase itself, which allows us to avoid the sensitivity problem. Then, phase is recursively estimated based on the estimated derivatives, which is named recurrent phase unwrapping (RPU). The experimental results confirm that the proposed method outperformed the direct phase estimation by a DNN.

研究动机与目标

  • 为解决直接基于DNN的相位重建因相位对波形偏移敏感而引起的不稳定性问题。
  • 通过利用相位导数而非原始相位,克服相位估计中的折叠效应。
  • 通过两阶段方法(先估计导数,再递归解缠)提高相位重建的准确性。
  • 开发一种鲁棒且可微的相位重建框架,使其在未见数据上具有良好泛化能力。
  • 验证所提方法在性能上优于直接相位估计及传统相位重建基线方法。

提出的方法

  • 该方法使用两个独立的DNN从对数幅度谱图中估计相位导数:瞬时频率(IF)和群时延(GD)。
  • 相位导数通过使用门控tanh激活函数的全连接DNN进行预测,并对输入特征进行归一化处理(当前帧及±2帧的对数幅度)。
  • 所提出的循环相位解缠(RPU)算法通过在时频单元上求解最小二乘优化问题,递归地重建未折叠相位。
  • RPU将相位重建视为二维相位解缠问题,通过最小化估计相位导数与真实相位导数之间的差异,同时保证相位的连续性。
  • 该方法避免了直接的相位回归,从而降低了对时域微小偏移的敏感性,解决了标准DNN的不稳定性问题。
  • 在评估中,通过格里夫斯-林算法(GLA)进行后处理,进一步提升了语音质量。

实验结果

研究问题

  • RQ1预测相位导数而非原始相位,是否能提升基于DNN的相位重建的稳定性和准确性?
  • RQ2两阶段方法(先估计导数,再递归解缠)是否优于直接相位估计?
  • RQ3所提出的RPU方法与基线方法(如使用冯·米塞斯DNN的直接相位估计和瞬时频率的数值积分)相比表现如何?
  • RQ4考虑到直接相位DNN存在过拟合倾向,该方法在未见测试数据上的泛化能力如何?
  • RQ5联合估计瞬时频率和群时延是否比单独使用瞬时频率能带来更精确的相位重建?

主要发现

  • 用于相位导数(IF和GD)的DNN在测试集上的准确率分别达到0.644和0.646,显著高于直接相位估计的0.003。
  • 直接相位估计DNN严重过拟合,训练准确率为0.238,但测试准确率仅为0.003,表明泛化能力极差。
  • 所提出的RPU方法在STOI(0.77)和PESQ(1.98)指标上均优于直接相位估计(STOI:0.72,PESQ:1.74)和仅使用IF的重建方法(STOI:0.75,PESQ:1.85)。
  • 即使将直接相位DNN在测试集上重新训练(Ph test),其在STOI和PESQ指标上仍表现不如所提方法,证实了RPU的鲁棒性。
  • 单侧t检验显示,STOI和PESQ指标上所提方法均具有统计显著性(p < 0.01)。
  • 音频样本显示,与基线方法相比,所提方法生成的语音更自然,伪影更少。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。