[论文解读] Single Channel Audio Source Separation using Convolutional Denoising Autoencoders
本文提出使用深度全卷积去噪自编码器(CDAEs)进行单通道语音源分离,在训练时为每个源分别训练一个CDAE,以提取目标成分,同时将其他源视为噪声。实验表明,CDAEs在参数量更少的情况下实现了具有竞争力的性能,尤其在分离鼓声等困难源方面表现优异。
Deep learning techniques have been used recently to tackle the audio source separation problem. In this work, we propose to use deep fully convolutional denoising autoencoders (CDAEs) for monaural audio source separation. We use as many CDAEs as the number of sources to be separated from the mixed signal. Each CDAE is trained to separate one source and treats the other sources as background noise. The main idea is to allow each CDAE to learn suitable spectral-temporal filters and features to its corresponding source. Our experimental results show that CDAEs perform source separation slightly better than the deep feedforward neural networks (FNNs) even with fewer parameters than FNNs.
研究动机与目标
- 为解决使用深度学习进行单通道语音源分离(SCSS)的挑战。
- 探究卷积去噪自编码器(CDAEs)是否能够学习到鲁棒的谱时特征以实现源分离。
- 从分离质量与参数效率两个方面,对比CDAE与全连接前馈神经网络(FNNs)的性能表现。
- 评估CDAE在处理高度非平稳背景噪声时的源分离有效性。
提出的方法
- 每个源均通过专用的CDAE进行分离,其他源在训练中被视为背景噪声。
- CDAE架构采用2D卷积层、ReLU激活函数,编码器部分使用最大池化,解码器部分使用转置卷积与上采样。
- 每个CDAE的输入为混合信号的2D幅值谱图片段,训练过程中引入噪声以增强模型鲁棒性。
- 通过公式 $ \mathbf{M}_{i}(n,f) = \frac{\mathbf{\tilde{S}}_{i}(n,f)}{\sum_{j}^{I}\mathbf{\tilde{S}}_{j}(n,f)} $ 计算谱掩码,以确保能量守恒。
- 最终通过使用混合信号的相位与掩码后的幅值谱图进行逆STFT,获得源信号估计。
- 训练采用Nesterov加速梯度法,配合早停与学习率衰减策略,以验证集损失为优化目标。
实验结果
研究问题
- RQ1全卷积去噪自编码器(CDAEs)能否有效从单通道音频混合信号中分离出各个独立源?
- RQ2CDAE在分离质量与参数效率方面与全连接前馈神经网络(FNNs)相比表现如何?
- RQ3CDAE架构是否比全连接网络更好地捕捉音频信号中的谱时结构?
- RQ4CDAE在处理如鼓声等难以分离的源时表现如何?
- RQ5CDAE能否在参数量少于FNNs的情况下实现高质量的分离?
主要发现
- 尽管参数量更少,CDAEs在源分离性能上仍略优于FNNs。
- CDAEs在分离鼓声方面相比FNNs有显著提升,后者是特别具有挑战性的源。
- CDAEs的归一化SDR与SIR值为正,表明其具备有效的分离能力与噪声抑制性能。
- CDAEs在所有源(除贝斯外)的SAR指标上均优于FNNs,表明分离信号中的伪影更少。
- 在SDR与SIR指标上,CDAEs与FNNs在人声与贝斯源上的表现相近。
- 谱掩码的使用确保了估计源的总和近似等于原始混合信号。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。