[论文解读] Audiobox: Unified Audio Generation with Natural Language Prompts
Audiobox 是一种基于流匹配的统一音频生成模型,可通过自然语言提示实现可控的、高质量的语音、音乐和音效合成。它在零样本文本到语音生成(Librispeech 相似度 0.745)和文本到声音生成(AudioCaps 上 FAD 为 0.77)方面达到最先进水平,通过基于描述和基于示例的提示提升了可控性,并通过专用求解器(Bespoke Solvers)显著提升了推理速度。
Audio is an essential part of our life, but creating it often requires expertise and is time-consuming. Research communities have made great progress over the past year advancing the performance of large scale audio generative models for a single modality (speech, sound, or music) through adopting more powerful generative models and scaling data. However, these models lack controllability in several aspects: speech generation models cannot synthesize novel styles based on text description and are limited on domain coverage such as outdoor environments; sound generation models only provide coarse-grained control based on descriptions like "a person speaking" and would only generate mumbling human voices. This paper presents Audiobox, a unified model based on flow-matching that is capable of generating various audio modalities. We design description-based and example-based prompting to enhance controllability and unify speech and sound generation paradigms. We allow transcript, vocal, and other audio styles to be controlled independently when generating speech. To improve model generalization with limited labels, we adapt a self-supervised infilling objective to pre-train on large quantities of unlabeled audio. Audiobox sets new benchmarks on speech and sound generation (0.745 similarity on Librispeech for zero-shot TTS; 0.77 FAD on AudioCaps for text-to-sound) and unlocks new methods for generating audio with novel vocal and acoustic styles. We further integrate Bespoke Solvers, which speeds up generation by over 25 times compared to the default ODE solver for flow-matching, without loss of performance on several tasks. Our demo is available at https://audiobox.metademolab.com/
研究动机与目标
- 解决现有音频生成模型在可控性和模态特异性方面的局限性。
- 在单一框架下统一语音和声音生成,支持基于描述和基于示例的提示。
- 通过自监督填空目标提升在低资源标注数据上的泛化能力。
- 在语音生成中实现对语音风格、文本内容和音频属性的细粒度控制。
- 开发一种可扩展、通用的音频生成模型,支持多样化的、真实场景中的音频内容。
提出的方法
- 基于流匹配的扩散模型架构,支持从文本或音频提示端到端生成音频。
- 基于描述的提示可独立控制文本内容、语音风格和声学环境。
- 基于示例的提示可通过短音频片段实现风格迁移,提升风格保真度。
- 将自监督填空目标适配用于大规模无标注音频的预训练,以提升泛化能力。
- 引入专用求解器(Bespoke Solvers),在不损失性能的前提下,使推理速度相比标准 ODE 求解器提升 25 倍以上。
- 采用联合 CLAP(Joint-CLAP)对齐音频与文本嵌入,提升跨模态的零样本泛化性能。
实验结果
研究问题
- RQ1统一的音频生成模型能否有效利用自然语言提示处理语音、音乐和声音等多种模态?
- RQ2如何将基于描述和基于示例的提示相结合,以提升语音生成的可控性?
- RQ3自监督填空预训练在低资源音频生成任务上的性能提升程度如何?
- RQ4专用推理求解器(如 Bespoke Solvers)对生成速度和质量的影响是什么?
- RQ5单一模型能否在零样本文本到语音和文本到声音基准测试中均达到最先进水平?
主要发现
- Audiobox 在零样本文本到语音生成任务中取得 0.745 的 Librispeech 相似度得分,创下新的 SOTA 基准。
- 在 AudioCaps 文本到声音生成基准测试中,Audiobox 实现 0.77 的 Fréchet Audio Distance(FAD)得分,优于先前方法。
- 该模型可在语音生成中独立控制文本内容、语音风格和声学环境,支持新型语音风格与声学环境的生成。
- 专用求解器(Bespoke Solvers)使音频生成速度相比标准 ODE 求解器提升 25 倍以上,同时保持生成质量。
- 自监督填空目标显著提升了在低资源标注数据上的泛化能力,尤其在罕见或复杂音频模式上表现突出。
- 联合 CLAP 对齐机制提升了语音、音乐和声音生成任务之间的零样本迁移性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。