[论文解读] SVSGAN: Singing Voice Separation via Generative Adversarial Network
本文提出SVSGAN,一种新颖的歌唱语音分离框架,采用条件生成对抗网络(CGAN)在频域中实现。通过以监督方式初始化深度神经网络生成器,并利用判别器对混合谱和干净谱分布进行对比,通过对抗训练进行微调,该方法在MIR-1K、iKala和DSD100数据集上均提升了源分离性能,在MIR-1K上达到最高6.78 dB的SDR,在iKala上达到10.32 dB的SDR,优于基线DNN模型。
Separating two sources from an audio mixture is an important task with many applications. It is a challenging problem since only one signal channel is available for analysis. In this paper, we propose a novel framework for singing voice separation using the generative adversarial network (GAN) with a time-frequency masking function. The mixture spectra is considered to be a distribution and is mapped to the clean spectra which is also considered a distribtution. The approximation of distributions between mixture spectra and clean spectra is performed during the adversarial training process. In contrast with current deep learning approaches for source separation, the parameters of the proposed framework are first initialized in a supervised setting and then optimized by the training procedure of GAN in an unsupervised setting. Experimental results on three datasets (MIR-1K, iKala and DSD100) show that performance can be improved by the proposed framework consisting of conventional networks.
研究动机与目标
- 为解决仅有单声道音频混合信号的单声道歌唱语音分离挑战,通过深度生成建模实现。
- 通过对抗训练,提升分离性能,超越传统监督深度神经网络(DNN)的性能。
- 探索使用时间-频率掩码的条件GAN,以从混合谱中建模干净谱的分布。
- 证明在监督设置下预训练生成器,随后通过无监督GAN进行微调,可提升分离质量。
提出的方法
- 该框架采用条件生成对抗网络(CGAN),其中生成器将混合谱图映射为干净人声和背景音乐谱图。
- 每个谱图被视为来自某一分布的样本向量,GAN学习从混合谱分布到干净谱分布的非线性映射。
- 生成器首先在干净谱和混合谱图上使用监督损失进行预训练,随后进行对抗微调。
- 判别器被训练以区分真实干净谱图与生成谱图,并以混合谱图为条件输入,以提升泛化能力。
- 时间-频率掩码函数由生成器输出推导,用于重建最终的分离信号。
- 模型采用1024点窗长和256点步长的STFT,提取幅度谱图用于训练和评估。
实验结果
研究问题
- RQ1将对抗训练应用于频域并结合条件GAN时,是否能提升歌唱语音分离性能?
- RQ2在监督设置下预训练生成器,随后通过GAN进行微调,是否相比纯监督DNN能提升分离质量?
- RQ3在判别器中引入混合谱作为条件输入,对分离模型性能有何影响?
- RQ4增加判别器的输入数量(如混合谱、人声和背景谱)在多大程度上能增强模型在多样化音乐流派中的泛化能力?
主要发现
- 在MIR-1K数据集上,SVSGAN在V+B+M配置下实现了6.78 dB的加权平均SDR,优于基线DNN的6.57 dB。
- 在iKala数据集上,SVSGAN在V+B+M配置下实现了10.32 dB的加权平均SDR,超过基线DNN的9.74 dB。
- SVSGAN (V+M)配置(将混合谱作为判别器输入)优于SVSGAN (V+B),表明从混合谱中学习到更优的结构信息。
- SVSGAN (V+B+M)配置(包含人声、背景和混合谱三者输入)达到最高性能,表明多输入条件可增强判别器的泛化能力。
- 在DSD100数据集上,SVSGAN (V+B+M)模型在测试集上实现了10.32 dB的中位SDR,尽管训练数据有限且未使用数据增强,仍表现出色。
- 结果表明,使用条件GAN的对抗训练可显著提升歌唱语音分离性能,即使在复杂多样的音乐流派中亦然。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。