Skip to main content
QUICK REVIEW

[论文解读] Interleaved Multitask Learning for Audio Source Separation with Independent Databases

Clement S. J. Doire, Olumide Okubadejo|arXiv (Cornell University)|Aug 14, 2019
Speech and Audio Processing参考文献 26被引用 4
一句话总结

本文提出了一种用于语音源分离的交错多任务学习框架,采用共享编码器和任务特定 解码器,可在独立数据库上进行训练,而无需在每个混合音频中包含所有源信号。该方法在参数量减少50%的情况下实现了与独立训练模型相当的性能,并提升了推理效率,同时支持新源类型的可迁移表征。

ABSTRACT

Deep Neural Network-based source separation methods usually train independent models to optimize for the separation of individual sources. Although this can lead to good performance for well-defined targets, it can also be computationally expensive. The multitask alternative of a single network jointly optimizing for all targets simultaneously usually requires the availability of all target sources for each input. This requirement hampers the ability to create large training databases. In this paper, we present a model that decomposes the learnable parameters into a shared parametric model (encoder) and independent components (decoders) specific to each source. We propose an interleaved training procedure that optimizes the sub-task decoders independently and thus does not require each sample to possess a ground truth for all of its composing sources. Experimental results on MUSDB18 with the proposed method show comparable performance to independently trained models, with less trainable parameters, more efficient inference, and an encoder transferable to future target objectives. The results also show that using the proposed interleaved training procedure leads to better Source-to-Interference energy ratios when compared to the simultaneous optimization of all training objectives, even when all composing sources are available.

研究动机与目标

  • 解决为语音源分离中每个音频源独立训练深度神经网络所面临的计算与数据整理挑战。
  • 在无需每个训练混合音频中均包含所有目标源的情况下,实现有效的多任务学习。
  • 在保持高分离质量的同时减少模型参数并提升推理效率。
  • 探索共享编码器向新语音源分离任务(如吉他、钢琴)迁移的可能性。
  • 探究交错训练是否在语音源分离质量方面优于同时进行的多任务优化。

提出的方法

  • 模型使用共享编码器从混合音频中提取通用特征,随后通过针对每个源(如人声、军鼓、贝斯)定制的独立解码器进行处理。
  • 网络通过交错训练程序进行训练:子任务解码器按顺序优化,而非同时优化,从而支持仅包含单一真实源的独立数据库训练。
  • 交错训练程序在每次迭代中交替更新每个解码器,同时固定编码器和其他解码器,以减少梯度干扰并提升优化稳定性。
  • 采用非累积版本的交错训练,以保持随机性,并避免累积变体中常见的梯度方向归一化问题。
  • 通过在更高分辨率层增加特征图数量(编码器+)对共享编码器进行微调,以提升容量,而无需增加解码器参数。
  • 该架构基于类似U-Net的卷积神经网络,包含跳跃连接和多带处理,专为一维语音谱图设计。

实验结果

研究问题

  • RQ1共享编码器架构搭配任务特定解码器是否能在语音源分离中实现与独立训练模型相当的性能?
  • RQ2在所有源均可用的情况下,交错训练于独立数据库是否优于同时进行的多任务优化?
  • RQ3通过交错优化训练的共享编码器是否可有效迁移到新的语音源分离任务中?
  • RQ4增加编码器容量(通过加宽高层层)相对于独立训练模型,性能如何变化?
  • RQ5交错训练程序是否能缓解共享架构中因模型容量降低导致的性能下降?

主要发现

  • 所提出的交错训练程序实现了与独立训练模型相当的SIR得分,其中非累积版本因保持了随机性而优于累积变体。
  • 共享编码器模型(约350万个参数)在SDR和SIR性能上与四个独立训练网络(总计约800万个参数)相当。
  • 在更高分辨率层增加编码器宽度(编码器+)可提升所有目标的SDR和SIR得分,且在军鼓、贝斯和其他源上的SIR得分超过独立训练模型。
  • 编码器+变体在军鼓(7.43 dB vs. 7.25 dB)、贝斯(4.37 dB vs. 3.8 dB)和其他源(2.25 dB vs. 2.04 dB)上的SIR得分高于独立训练模型,而在人声上略逊色(9.28 dB vs. 9.35 dB)。
  • 共享编码器表征具有可迁移性,可作为吉他或钢琴等新语音源分离任务的有效初始化。
  • 该方法支持使用无源间数据重叠的独立数据库,显著扩展了训练数据潜力,而无需为每个混合音频提供完整源标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。