[论文解读] Listen to What You Want: Neural Network-based Universal Sound Selector
本文提出 Sound Selector,一种深度神经网络,通过学习的 n-hot 类别表示,直接从音频混合信号中提取多个所需的声学事件(AE),无需进行源分离或分类。该方法在未见的源数量和目标类别数量下均表现出一致的高性能,展现出强大的泛化能力与计算效率。
Being able to control the acoustic events (AEs) to which we want to listen would allow the development of more controllable hearable devices. This paper addresses the AE sound selection (or removal) problems, that we define as the extraction (or suppression) of all the sounds that belong to one or multiple desired AE classes. Although this problem could be addressed with a combination of source separation followed by AE classification, this is a sub-optimal way of solving the problem. Moreover, source separation usually requires knowing the maximum number of sources, which may not be practical when dealing with AEs. In this paper, we propose instead a universal sound selection neural network that enables to directly select AE sounds from a mixture given user-specified target AE classes. The proposed framework can be explicitly optimized to simultaneously select sounds from multiple desired AE classes, independently of the number of sources in the mixture. We experimentally show that the proposed method achieves promising AE sound selection performance and could be generalized to mixtures with a number of sources that are unseen during training.
研究动机与目标
- 解决现有级联源分离与分类方法在从复杂音频混合信号中选择所需声学事件(AE)时的局限性。
- 开发一种统一框架,直接提取目标 AE,而无需事先知晓混合信号中源的数量。
- 通过单次前向传播实现多个 AE 类别的同时选择,相比迭代方法显著降低计算成本。
- 提升模型对未见混合条件的泛化能力,例如训练时未见过的更高数量 AE 类别或更多目标类别。
- 提供一种计算高效、端到端的 AE 声音选择解决方案,适用于实时可听设备。
提出的方法
- Sound Selector 使用深度神经网络(DNN),以原始时域音频混合信号和表示目标 AE 类别的 one-hot 或 n-hot 向量作为输入。
- 网络通过可微损失函数直接估计所选 AE 声音的时域波形,该损失函数针对声音选择性能进行优化。
- 在多类别选择中,网络通过共享架构与联合优化,在单次前向传播中同时提取多个 AE 类别。
- 该方法通过直接建模选择而非分离,避免了基于排列不变训练(PIT)的分离方法中固有的排列歧义与固定源限制。
- 框架在包含不同 AE 类别数量与目标组合的合成混合信号数据集上进行端到端训练。
- 该模型可泛化至训练时未见过的混合信号,包括 7 类混合与 4 类同时选择,无需重新训练。
实验结果
研究问题
- RQ1深度神经网络能否仅通过类别标签作为引导,直接从混合信号中提取多个所需声学事件,而无需预先进行源分离?
- RQ2直接声音选择方法与级联的源分离加分类方法相比,性能如何?
- RQ3所提出方法能否泛化至训练时未见过的 AE 类别数量更多的混合信号?
- RQ4与迭代式单类别提取相比,同时进行多类别选择是否在质量与效率上更具优势?
- RQ5该模型在真实世界类似音频场景中,对未见过的源数量与目标类别数量的泛化能力如何?
主要发现
- 所提出的 Sound Selector 在包含 3 至 5 个 AE 类别的混合信号中,对双类别选择实现了平均 SDR 提升 6.9 dB,部分情况下优于迭代方法。
- 在四类别同时选择任务中,模型在未见过的 7 类混合信号上实现了平均 SDR 提升 5.3 dB,表明其对更高复杂度场景具有强大泛化能力。
- 同时提取方案在显著降低计算成本的前提下,实现了与迭代提取相当或更优的性能。
- 即使在包含三个目标类别的高复杂度场景下,模型仍保持高达 16.9 dB 的绝对 SDR,表明信号失真极小。
- 模型在未包含于训练数据中的七类 AE 混合信号与四类目标选择任务中均表现出有效泛化,证实其对未见条件的鲁棒性。
- 声音抑制实验表明,SDR 改进稳定在约 6 dB,证实该方法在选择与抑制任务中均具有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。