Skip to main content
QUICK REVIEW

[论文解读] A comparison of handcrafted, parameterized, and learnable features for speech separation

Wenbo Zhu, Mou Wang|arXiv (Cornell University)|Nov 29, 2020
Speech and Audio Processing参考文献 14被引用 7
一句话总结

该论文在Conv-Tasnet框架中对比了手工设计(STFT、MPGTF)、参数化(ParaMPGTF)和可学习特征在语音分离中的表现。论文提出了ParaMPGTF,即多相位伽马函数滤波器组的可学习扩展,并发现当解码器可学习时,所有特征类型表现相似——STFT略胜一筹;而当使用伪逆解码器时,ParaMPGTF优于手工设计特征。

ABSTRACT

The design of acoustic features is important for speech separation. It can be roughly categorized into three classes: handcrafted, parameterized, and learnable features. Among them, learnable features, which are trained with separation networks jointly in an end-to-end fashion, become a new trend of modern speech separation research, e.g. convolutional time domain audio separation network (Conv-Tasnet), while handcrafted and parameterized features are also shown competitive in very recent studies. However, a systematic comparison across the three kinds of acoustic features has not been conducted yet. In this paper, we compare them in the framework of Conv-Tasnet by setting its encoder and decoder with different acoustic features. We also generalize the handcrafted multi-phase gammatone filterbank (MPGTF) to a new parameterized multi-phase gammatone filterbank (ParaMPGTF). Experimental results on the WSJ0-2mix corpus show that (i) if the decoder is learnable, then setting the encoder to STFT, MPGTF, ParaMPGTF, and learnable features lead to similar performance; and (ii) when the pseudo-inverse transforms of STFT, MPGTF, and ParaMPGTF are used as the decoders, the proposed ParaMPGTF performs better than the other two handcrafted features.

研究动机与目标

  • 在相同的Conv-Tasnet框架内,首次系统性比较手工设计、参数化和可学习特征在语音分离中的表现。
  • 探究可学习特征是否在端到端语音分离中始终优于手工设计和参数化替代方案。
  • 通过将手工设计的MPGTF扩展为可学习形式(即ParaMPGTF),评估参数化特征的有效性。
  • 确定在不同训练配置下,编码器与解码器特征的选择是否显著影响分离性能。

提出的方法

  • 提出参数化多相位伽马函数滤波器组(ParaMPGTF),其中中心频率和带宽与分离网络联合优化。
  • 通过将Conv-Tasnet架构中的标准1D-conv编码器和解码器替换为STFT、MPGTF、ParaMPGTF或可学习滤波器,对模型进行适配。
  • 在编码器输出上使用ReLU激活,以确保时频表示非负。
  • 采用尺度不变信噪比(SI-SNR)作为优化损失,用于分离性能评估。
  • 使用STFT、MPGTF和ParaMPGTF的伪逆变换作为解码器,以在无可学习解码器的情况下比较重建质量。
  • 使用可学习解码器和固定(伪)逆解码器训练模型,以隔离特征设计的影响。

实验结果

研究问题

  • RQ1当使用可学习解码器时,作为编码器的的手工设计特征(STFT、MPGTF)、参数化特征(ParaMPGTF)和可学习特征在性能上如何比较?
  • RQ2在可学习解码器设置下,手工设计MPGTF的参数化扩展(即ParaMPGTF)是否优于原始MPGTF?
  • RQ3当将手工设计特征的解码器替换为可学习的逆变换时,其性能是否提升?在此设置下,ParaMPGTF的表现如何?
  • RQ4在使用(伪)逆解码器时,可学习特征与手工设计/参数化特征在训练收敛行为上有什么不同?

主要发现

  • 当解码器可学习时,STFT、MPGTF、ParaMPGTF和可学习特征的性能相近,其中STFT在测试集上达到最高的SI-SNR(17.28 dB)。
  • 在可学习解码器设置下,ParaMPGTF略优于MPGTF,在测试集上达到17.06 dB的SI-SNR,而MPGTF在开发集上为17.20 dB。
  • 当使用(伪)逆变换作为解码器时,ParaMPGTF表现最佳,在开发集上达到16.64 dB的SI-SNR,测试集上为16.04 dB,优于STFT(16.31/15.82 dB)和MPGTF(16.32/15.73 dB)。
  • 收敛曲线显示,可学习特征的收敛速度优于手工设计和参数化特征,且ParaMPGTF在训练后期相比MPGTF表现出更快的收敛速度。
  • ParaMPGTF的优化参数(c₁=25.09, c₂=9.198)接近手工设计的MPGTF参数(c₁=24.7, c₂=9.265),解释了两者在可学习解码器下性能相似的原因。
  • 幅度谱图的可视化结果表明,ParaMPGTF与MPGTF产生相似的滤波器响应,验证了参数化设计的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。