Skip to main content
QUICK REVIEW

[论文解读] Automatic music mixing with deep learning and out-of-domain data

Marco A. Martínez-Ramírez, Wei‐Hsiang Liao|arXiv (Cornell University)|Aug 24, 2022
Music and Audio Processing被引用 12
一句话总结

本文提出了一种新颖的数据预处理方法,通过归一化音频效果特征(音量、均衡、声像、动态范围压缩、混响),使使用常见但此前无法使用的域外湿式多轨录音进行深度学习模型训练成为可能,从而实现自动音乐混音。在专业工程师参与的主观测试中,该方法生成的混音与专业人工混音无异,显著提升了自动化混音的质量,且无需使用稀有的干式多轨录音数据。

ABSTRACT

Music mixing traditionally involves recording instruments in the form of clean, individual tracks and blending them into a final mixture using audio effects and expert knowledge (e.g., a mixing engineer). The automation of music production tasks has become an emerging field in recent years, where rule-based methods and machine learning approaches have been explored. Nevertheless, the lack of dry or clean instrument recordings limits the performance of such models, which is still far from professional human-made mixes. We explore whether we can use out-of-domain data such as wet or processed multitrack music recordings and repurpose it to train supervised deep learning models that can bridge the current gap in automatic mixing quality. To achieve this we propose a novel data preprocessing method that allows the models to perform automatic music mixing. We also redesigned a listening test method for evaluating music mixing systems. We validate our results through such subjective tests using highly experienced mixing engineers as participants.

研究动机与目标

  • 解决干式多轨录音严重缺乏的问题,该问题限制了深度学习模型在自动音乐混音中的性能。
  • 探索是否可以将域外湿式多轨数据重新用于监督训练自动混音系统。
  • 开发一种数据归一化技术,使模型能够学习逆转音频效果并重建原始混音。
  • 设计基于感知的听音测试,由经验丰富的混音工程师客观评估系统性能。
  • 仅使用现有湿式数据集,实现与专业人工混音质量相当的自动混音。

提出的方法

  • 提出一种新颖的数据预处理流程,通过利用域外数据集计算的平均特征,对每个音频效果类别(音量、均衡、声像、动态范围压缩、混响)在音轨上进行归一化。
  • 针对每种乐器类型计算平均音量(LUFS)和频谱幅度谱(通过STFT),以建立目标归一化配置。
  • 应用特定效果的归一化方法:通过增益调节实现音量归一化,通过滤波器匹配实现均衡归一化以匹配目标频谱,通过双通道电平归一化实现声像归一化,通过动态范围均衡实现压缩归一化,通过频谱衰减归一化实现混响归一化。
  • 训练深度神经网络以预测混音参数(增益、均衡、声像、动态范围压缩、混响),通过反归一化已归一化的音轨,从而有效学习逆转效果。
  • 使用立体声不变损失函数,以提升立体声输出的泛化能力和感知质量。
  • 在推理阶段对真实干式多轨数据应用相同的预处理流程,实现端到端的自动混音。

实验结果

研究问题

  • RQ1在域外湿式多轨数据上进行训练的深度学习模型,能否生成与专业人工混音相当的音乐混音?
  • RQ2一种数据归一化技术是否能有效弥合湿式训练数据与干式推理数据之间的分布差距,用于自动混音?
  • RQ3与专业人工混音相比,专家混音工程师如何评价模型生成混音的感知质量?
  • RQ4所提出的立体声不变损失函数是否提升了最终混音的感知质量?
  • RQ5该模型是否能在无干式训练数据的情况下,跨多种音乐流派保持高质量混音并实现良好泛化?

主要发现

  • 在经验丰富的工程师参与的主观听音测试中,所提方法生成的混音在制作价值和兴奋度方面与专业人工混音无异。
  • 模型生成的混音在清晰度方面得分显著高于专业混音,表明其具有更优的感知透明度。
  • 听音测试显示,专家极少将专业混音评为“非常好”,凸显了评估任务的难度,也反映出本系统所达到的高标准。
  • 该模型在所有感知指标上均优于基线Wave-U-Net模型(WUN),在制作价值和兴奋度方面具有统计学显著性提升(p < 0.001)。
  • 立体声不变损失函数有助于提升泛化能力和感知质量,尤其在空间成像和平衡方面表现更优。
  • 该方法成功实现了在现有湿式数据集(如MUSDB18)上的训练,无需昂贵的干式多轨录音采集。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。