Skip to main content
QUICK REVIEW

[论文解读] Is CQT more suitable for monaural speech separation than STFT? an empirical study

Ziqiang Shi, Huibin Lin|arXiv (Cornell University)|Feb 2, 2019
Speech and Audio Processing参考文献 19被引用 7
一句话总结

本文研究了常数Q变换(CQT)在单耳语音分离任务中是否优于短时傅里叶变换(STFT)作为前端。基于WSJ0-2mix语料库,作者通过实证表明,CQT-based模型在信噪比(SDR)上平均比STFT-based方法提升0.4 dB,这得益于CQT的非线性频率分辨率更符合人类听觉感知特性。

ABSTRACT

Short-time Fourier transform (STFT) is used as the front end of many popular successful monaural speech separation methods, such as deep clustering (DPCL), permutation invariant training (PIT) and their various variants. Since the frequency component of STFT is linear, while the frequency distribution of human auditory system is nonlinear. In this work we propose and give an empirical study to use an alternative front end called constant Q transform (CQT) instead of STFT to achieve a better simulation of the frequency resolving power of the human auditory system. The upper bound in signal-to-distortion (SDR) of ideal speech separation based on CQT's ideal ration mask (IRM) is higher than that based on STFT. In the same experimental setting on WSJ0-2mix corpus, we examined the performance of CQT under different backends, including the original DPCL, utterance level PIT, and some of their variants. It is found that all CQT-based methods are better than STFT-based methods, and achieved on average 0.4dB better performance than STFT based method in SDR improvements.

研究动机与目标

  • 通过利用其非线性频率分辨率,评估CQT是否比STFT更适合用于单耳语音分离。
  • 解决STFT线性频率分箱的局限性,其与人类听觉感知不一致。
  • 在标准化设置下,对多种深度学习后端进行CQT与STFT的实证比较。
  • 确定基于CQT的理想比值掩蔽(IRMs)是否优于基于STFT的IRMs,获得更高的上限SDR。
  • 评估CQT性能提升在不同训练框架(包括DPCL和PIT变体)中的泛化能力。

提出的方法

  • 在单耳语音分离模型中,用CQT替代标准STFT前端,以更好地模拟人类听觉频率分辨率。
  • 基于CQT和STFT表示计算理想比值掩蔽(IRMs),以确立上限性能边界。
  • 使用相同架构和超参数训练并评估多个模型,仅在前端变换(CQT与STFT)上存在差异。
  • 应用标准的单耳分离后端,包括深度聚类(DPCL)、排列不变训练(PIT)及其变体。
  • 使用WSJ0-2mix数据集以确保所有实验的一致性评估。
  • 以信噪比(SDR)为主要指标衡量性能。

实验结果

研究问题

  • RQ1基于CQT的理想比值掩蔽是否比基于STFT的理想比值掩蔽获得更高的上限SDR?
  • RQ2在多种深度学习后端中,CQT-based模型是否在单耳语音分离任务中全面优于STFT-based模型?
  • RQ3CQT带来的性能增益在DPCL和PIT等不同训练框架中是否保持一致?
  • RQ4与STFT的线性分辨率相比,CQT的非线性频率分辨率在多大程度上提升了分离性能?
  • RQ5CQT是否能作为比STFT更符合生物合理性的语音分离前端?

主要发现

  • 基于CQT的理想比值掩蔽(IRMs)获得的上限信噪比(SDR)高于基于STFT的IRMs。
  • 所有基于CQT的模型在多种后端(包括DPCL和话语级PIT)中均优于其STFT对应模型。
  • 在WSJ0-2mix语料库上,CQT-based方法平均比STFT-based方法提升0.4 dB SDR。
  • 性能增益在不同模型变体中保持一致,表明CQT作为前端具有鲁棒性。
  • 结果表明,CQT的非线性频率分辨率更符合人类听觉感知,从而带来更好的分离性能。
  • 实证证据支持CQT在上限性能和实际性能方面均优于STFT,是单耳语音分离任务中的更优选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。