Skip to main content
QUICK REVIEW

[论文解读] From Discrete Tokens to High-Fidelity Audio Using Multi-Band Diffusion

Robin San Roman, Yossi Adi|arXiv (Cornell University)|Aug 2, 2023
Music and Audio ProcessingComputer Science被引用 3
一句话总结

本文提出多带扩散(Multi-Band Diffusion, MBD),一种高保真度音频生成框架,通过使用频带特定的扩散模型、频率均衡器和新型能量噪声调度器,从低比特率离散音频标记中合成自然语音、音乐和环境声音。该方法在客观指标和人工评估中显著优于最先进水平的 GAN 和基于扩散的基线模型,在 6 kbps 下实现了卓越的感知质量。

ABSTRACT

Deep generative models can generate high-fidelity audio conditioned on various types of representations (e.g., mel-spectrograms, Mel-frequency Cepstral Coefficients (MFCC)). Recently, such models have been used to synthesize audio waveforms conditioned on highly compressed representations. Although such methods produce impressive results, they are prone to generate audible artifacts when the conditioning is flawed or imperfect. An alternative modeling approach is to use diffusion models. However, these have mainly been used as speech vocoders (i.e., conditioned on mel-spectrograms) or generating relatively low sampling rate signals. In this work, we propose a high-fidelity multi-band diffusion-based framework that generates any type of audio modality (e.g., speech, music, environmental sounds) from low-bitrate discrete representations. At equal bit rate, the proposed approach outperforms state-of-the-art generative techniques in terms of perceptual quality. Training and, evaluation code, along with audio samples, are available on the facebookresearch/audiocraft Github page.

研究动机与目标

  • 为解决从离散表示生成低比特率音频时出现的可听伪影问题,尤其是在条件控制不完善的情况下。
  • 通过用基于扩散的方法替代 GAN 声码器,提升音频合成的感知质量并减少伪影。
  • 实现从压缩的离散标记序列中生成高保真、通用的音频(如语音、音乐、环境声音)。
  • 开发一种可扩展且鲁棒的扩散框架,在多种音频领域和低比特率下保持高保真度。
  • 证明扩散模型可以有效替代端到端音频压缩与生成流水线中传统的 GAN 基声码器。

提出的方法

  • 该方法采用多带扩散架构,独立处理非重叠的频带,减少误差累积,并实现在每个频带上的针对性去噪。
  • 频率均衡器(EQ)处理器通过归一化各频带的能量分布,使数据分布与先验高斯分布对齐,从而提升训练稳定性和生成质量。
  • 引入一种新型能量噪声调度器,以更好地处理具有丰富谐波成分的音频信号,改善高频区域的去噪过程。
  • 模型在压缩模型(如 EnCodec)生成的离散标记序列上进行端到端训练,每个频带均基于其对应的潜在表示进行条件控制。
  • 通过基于学习到的离散码进行条件控制,该框架支持对多种音频模态(如语音、音乐、环境声音)实现零样本适应。
  • 该方法与现有序列建模流水线兼容,例如在音频标记上使用语言模型的系统(如 Bark、MusicGen),可作为声码器的即插即用替代方案。

实验结果

研究问题

  • RQ1基于扩散的模型是否能在低比特率离散表示下生成高保真音频,优于基于 GAN 的声码器?
  • RQ2与全带扩散或单带方法相比,多带扩散架构是否能减少误差传播并提升生成质量?
  • RQ3频率均衡器和能量噪声调度器在多大程度上提升了生成音频的保真度和感知质量?
  • RQ4当基于离散标记进行条件控制时,该方法在语音、音乐和环境声音等多样化音频领域中是否具备泛化能力?
  • RQ5在低比特率(如 6 kbps)下,多带扩散模型在人工评估和客观指标中的感知质量与最先进基线相比如何?

主要发现

  • 在 6 kbps 下,MBD 模型的 ViSQOL 得分为 3.67 ± 0.02,显著优于基线 EnCodec(64.34 MUSHRA)及其他基线模型。
  • 人工评估显示,与 EnCodec 基线相比,MBD 在语音上的 MUSHRA 得分平均提升 +11.76 分,在音乐上提升 +4.0 分。
  • 在 6 kbps 下,MBD 模型的 Mel-SNR-M 得分为 9.85,优于无处理器变体(9.68)和线性调度器(7.10),证明了完整流水线的有效性。
  • 频率均衡器和能量噪声调度器是关键组件:移除 EQ 处理器会使 ViSQOL 下降 0.29 分,而使用线性调度器则导致性能显著下降。
  • 在文本到语音和文本到音乐生成中,与标准 GAN 基声码器相比,MBD 显著减少了可听伪影(尤其是金属感或失真声音)。
  • 该方法在客观指标(ViSQOL、Mel-SNR)和主观人工评估中均达到最先进水平,证实其在感知质量与分布内生成方面的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。