Skip to main content
QUICK REVIEW

[论文解读] Neural Network Alternatives to Convolutive Audio Models for Source Separation

Shrikant Venkataramani, Y. Cem Sübakan|arXiv (Cornell University)|Sep 20, 2017
Speech and Audio Processing参考文献 8被引用 4
一句话总结

本文提出一种卷积自编码器(CAE)作为卷积非负矩阵分解(conv-NMF)在语音源分离任务中的神经网络替代方法。通过可学习的卷积滤波器建模频谱-时域模式,CAE 能够捕捉语音频谱图中的时序依赖性,显著优于前馈自编码器,在 K=80 个滤波器时达到峰值 SDR 性能,并在不同滤波器数量下均表现出稳健性能。

ABSTRACT

Convolutive Non-Negative Matrix Factorization model factorizes a given audio spectrogram using frequency templates with a temporal dimension. In this paper, we present a convolutional auto-encoder model that acts as a neural network alternative to convolutive NMF. Using the modeling flexibility granted by neural networks, we also explore the idea of using a Recurrent Neural Network in the encoder. Experimental results on speech mixtures from TIMIT dataset indicate that the convolutive architecture provides a significant improvement in separation performance in terms of BSSeval metrics.

研究动机与目标

  • 开发一种基于神经网络的替代方法,用于建模音频频谱图中的时序依赖性,以替代卷积非负矩阵分解(conv-NMF)。
  • 解决标准 NMF 和前馈自编码器在捕捉帧间频谱-时域模式方面的局限性。
  • 探索在干净语音频谱图上进行生成式预训练,以提升模型在不同混合类型上的泛化能力。
  • 评估卷积和循环-卷积自编码器架构在监督式源分离任务中的性能表现。
  • 证明灵活的神经网络架构在分离任务中可超越传统基于分解的模型。

提出的方法

  • 该模型采用两阶段卷积自编码器结构:卷积编码器从输入频谱图中估计激活码,解码器则利用学习到的基函数滤波器重建输入。
  • 编码器通过大小为 M×T 的滤波器 W^‡ 进行卷积运算,计算激活值 H(i,t),将其解释为输入的非负、生成式编码。
  • 解码器通过将激活矩阵 H 与基函数滤波器 W_i 进行卷积,重建输入频谱图 X̂(f,t),形成一种时频基函数分解。
  • 网络采用小批量梯度下降配合 RMSProp 优化,应用 Xavier 初始化,并施加稀疏性约束以强制实现非负性。
  • 引入一种循环-卷积自编码器(RCAE)变体,结合循环层与卷积编码器,以建模长程时序依赖性。
  • 在 TIMIT 语音混合数据集上,使用 BSSeval 指标(SDR、SIR、SAR)评估模型性能,滤波器数量 K 从 10 到 100 不等。

实验结果

研究问题

  • RQ1卷积自编码器能否有效学习到优于标准前馈自编码器的频谱-时域基函数,从而提升源分离性能?
  • RQ2通过卷积层引入时序上下文是否能带来相较于非卷积模型的可测量性能提升?
  • RQ3混合循环-卷积架构是否能进一步增强对语音信号中长期依赖性的建模能力?
  • RQ4所提出的自编码器模型性能对基函数滤波器数量(K)的敏感程度如何?
  • RQ5在干净频谱图上进行生成式预训练在多大程度上能提升模型对未见混合类型的泛化能力?

主要发现

  • 卷积自编码器(CAE)在中位数 SDR 和 SIR 指标上显著优于其前馈自编码器基线模型,且分离过程中的干扰更少。
  • CAE 在 K=80 个滤波器时达到最佳分离性能,且在多个 K 值下均观察到中位数 SDR 的增益。
  • 当 K≥50 时,SDR 的方差显著降低,表明滤波器数量增加后性能更加稳定。
  • RCAE 变体同样优于前馈模型,尽管性能提升幅度小于 CAE,表明卷积建模在语音混合任务中更为有效。
  • CAE 模型的 SDR 四分位距始终高于前馈模型,表明其在各类混合场景下表现更稳健。
  • 尽管 CAE 模型的 SAR 略有下降,但 SIR 的显著提升有效补偿了这一损失,整体分离质量更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。