[论文解读] Solving Audio Inverse Problems with a Diffusion Model
本文提出 CQT-Diff,一种基于扩散的生成模型,利用常数 Q 变换(CQT)的音高等变结构,无需微调即可解决多种音频逆问题——如带宽扩展、补全和去削波。通过使用可逆 CQT 对扩散模型进行预处理,该方法在带宽扩展任务中达到最先进性能,在补全和去削波任务中也表现出竞争力,首次实现了使用扩散模型进行音频恢复的通用、问题无关的框架。
This paper presents CQT-Diff, a data-driven generative audio model that can, once trained, be used for solving various different audio inverse problems in a problem-agnostic setting. CQT-Diff is a neural diffusion model with an architecture that is carefully constructed to exploit pitch-equivariant symmetries in music. This is achieved by preconditioning the model with an invertible Constant-Q Transform (CQT), whose logarithmically-spaced frequency axis represents pitch equivariance as translation equivariance. The proposed method is evaluated with objective and subjective metrics in three different and varied tasks: audio bandwidth extension, inpainting, and declipping. The results show that CQT-Diff outperforms the compared baselines and ablations in audio bandwidth extension and, without retraining, delivers competitive performance against modern baselines in audio inpainting and declipping. This work represents the first diffusion-based general framework for solving inverse problems in audio processing.
研究动机与目标
- 开发一种统一的、问题无关的框架,利用单一预训练生成模型解决多种音频逆问题。
- 解决现有方法局限于特定退化类型且需任务特定微调的局限性。
- 探究经由可逆时频变换预处理的扩散模型是否能在多种音频恢复任务中实现泛化。
- 评估音高等变归纳偏置(特别是通过常数 Q 变换实现)对提升音频恢复性能的作用。
- 证明单一生成模型可在无需任务特定微调的情况下,在多个音频恢复任务中实现竞争力或最先进性能。
提出的方法
- 该方法采用在时域训练的基于分数的扩散模型,并利用可逆常数 Q 变换(CQT)作为预处理步骤,以利用音高等变性。
- CQT 的对数频率轴布局确保音高移位对应于平移,从而支持尊重谐波结构的卷积层。
- 模型使用噪声调度和随机反向 SDE 从学习到的分数函数中采样,分数由神经网络 $ s_{\theta}(\bm{x}_{\tau}, \sigma_{\tau}) $ 近似。
- 通过重建引导(RG)项和可选的去噪分类器(DC)实现对逆问题的条件控制,支持在部分观测条件下的灵活推理。
- 模型在独奏钢琴音乐上进行训练,并在三个任务上进行评估:带宽扩展、补全和去削波,采用客观和主观指标。
- 该框架通过在已知退化模型(如低通滤波、信号间隙或硬削波)上进行条件控制,支持线性和非线性逆问题。
实验结果
研究问题
- RQ1单一预训练扩散模型是否能在无需微调的情况下泛化至多种音频逆问题?
- RQ2使用可逆 CQT 对扩散模型进行预处理,是否能通过利用音高等变对称性来提升音频恢复性能?
- RQ3基于 CQT 的扩散模型在带宽扩展、补全和去削波任务中的性能与任务特定基线相比如何?
- RQ4重建引导在保持音频补全过程中的时间连贯性方面起到什么作用?
- RQ5在严重退化场景(如去削波中信噪比低)下,扩散模型的生成先验是否能超越判别式方法?
主要发现
- CQT-Diff 在音频带宽扩展任务中达到最先进性能,在客观和主观评估中均优于所有对比基线。
- 在音频补全任务中,CQT-Diff 的 MUSHRA 得分略高于 GACELA,表明其在未专门针对该任务训练的情况下仍具有竞争力。
- 在 1 dB SDR 的去削波任务中,CQT-Diff 的 FAD(1.84)、PEAQ(-3.53)和 PEMO-Q(-3.36)得分均最优,优于 A-SPADE 和 SS-PEW,尤其在最严重退化情况下表现突出。
- 在 10 dB SDR 条件下,CQT-Diff 的性能被 SS-PEW 超越,主要受限于生成模型质量,但其性能仍与 A-SPADE 相当。
- 重建引导(RG)在补全任务中至关重要,因其显著提升了时间连贯性和合理性,表明模型架构本身不足以处理长时依赖。
- 结果证实,CQT 预处理提供了有意义的归纳偏置,使模型能通过单一统一架构泛化至多种多样的逆问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。