Skip to main content
QUICK REVIEW

[论文解读] A Unified Model for Zero-shot Music Source Separation, Transcription and Synthesis

Liwei Lin, Qiuqiang Kong|arXiv (Cornell University)|Aug 7, 2021
Music and Audio Processing被引用 9
一句话总结

该论文提出了一种统一的、零样本深度学习模型,通过解耦音高与音色表征,联合实现音乐源分离、自动音乐转录(AMT)和音频合成。该模型采用示例查询输入,并引入新颖的归纳偏置——音高使用向量量化,音色使用音高平移不变损失。该模型在实现最先进分离性能的同时,能够从未见过的乐器中合成新音乐,且转录乐谱作为辅助信号显著提升了分离效果。

ABSTRACT

We propose a unified model for three inter-related tasks: 1) to extit{separate} individual sound sources from a mixed music audio, 2) to extit{transcribe} each sound source to MIDI notes, and 3) to extit{ synthesize} new pieces based on the timbre of separated sources. The model is inspired by the fact that when humans listen to music, our minds can not only separate the sounds of different instruments, but also at the same time perceive high-level representations such as score and timbre. To mirror such capability computationally, we designed a pitch-timbre disentanglement module based on a popular encoder-decoder neural architecture for source separation. The key inductive biases are vector-quantization for pitch representation and pitch-transformation invariant for timbre representation. In addition, we adopted a query-by-example method to achieve extit{zero-shot} learning, i.e., the model is capable of doing source separation, transcription, and synthesis for extit{unseen} instruments. The current design focuses on audio mixtures of two monophonic instruments. Experimental results show that our model outperforms existing multi-task baselines, and the transcribed score serves as a powerful auxiliary for separation tasks.

研究动机与目标

  • 将音乐处理的三个核心任务——源分离、转录与合成——统一到一个零样本框架中。
  • 通过示例查询输入,使模型能够在不重新训练的情况下泛化到未见过的乐器。
  • 通过利用解耦的音高与音色表征作为辅助信号,提升源分离性能。
  • 设计归纳偏置,以强制实现音高与音色的有意义解耦,从而提升泛化能力与合成保真度。
  • 证明转录乐谱在多任务设置中能显著提升源分离性能。

提出的方法

  • 模型使用示例查询(QBE)网络,将单个乐器的干净音频样本嵌入低维向量。
  • 音高-音色解耦模块通过向量量化处理音高、通过音高平移不变损失处理音色,将混合音频源的潜在表征分离为独立的音高与音色向量。
  • 转录组件将解耦的音高表征转换为MIDI音符,实现自动音乐转录。
  • 采用音频编码器-解码器架构,从解耦的音高与音色表征中重建分离的音频源。
  • 模型通过端到端多任务训练,使用对比损失与重建损失联合优化源分离、转录与合成目标。
  • 通过音高平移不变的音色损失实现音频合成,使解码器能够使用相同音色表征生成新的音高序列。

实验结果

研究问题

  • RQ1一个统一的模型是否能够在不为新乐器重新训练的情况下,实现零样本音乐源分离、转录与合成?
  • RQ2音高-音色解耦在多任务学习框架中如何提升源分离与转录的性能?
  • RQ3所提出的归纳偏置——音高使用向量量化、音色使用音高平移不变性——在多大程度上增强了表征解耦与泛化能力?
  • RQ4转录乐谱是否可作为有意义的辅助信号,显著提升源分离性能?
  • RQ5在解耦质量(用于合成)与重建保真度(用于分离)之间存在何种权衡?

主要发现

  • 所提出的MSI模型在源分离任务上相比多任务与单任务基线模型,SDR指标提升1.06分,证明了解耦表征联合学习的优势。
  • 模型在未见过的乐器上实现了零样本性能,如图4与音频演示所示,成功完成分离与转录。
  • MSI-DIS变体(包含音高平移不变损失)能够从未见音色中成功合成新音频,而标准MSI模型则不能,证明了该归纳偏置的有效性。
  • 尽管MSI-DIS模型的合成质量更优,但其分离性能略低于MSI模型,表明解耦质量与重建保真度之间存在权衡。
  • 解耦的音高表征显著提升了分离性能,转录乐谱作为强大辅助信号的作用得到验证,相较于仅使用MSS的基线模型性能有明显提升。
  • 时频图的视觉检查显示,MSI-DIS模型产生的输出更清晰、更接近单音,而MSI模型有时会同时分离出多个音高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。