[论文解读] Catch-A-Waveform: Learning to Generate Audio from a Single Short Example
本文提出了一种基于生成对抗网络(GAN)的模型 Catch-A-Waveform(CAW),该模型仅需一个极短的音频样本(最短仅20秒)即可生成高质量且多样化的音频样本,无需预训练或外部监督。该模型学习输入波形的统计结构,支持音频补全、超分辨率和去噪等应用,即使在数据极少的情况下也能实现最先进性能。
Models for audio generation are typically trained on hours of recordings. Here, we illustrate that capturing the essence of an audio source is typically possible from as little as a few tens of seconds from a single training signal. Specifically, we present a GAN-based generative model that can be trained on one short audio signal from any domain (e.g. speech, music, etc.) and does not require pre-training or any other form of external supervision. Once trained, our model can generate random samples of arbitrary duration that maintain semantic similarity to the training waveform, yet exhibit new compositions of its audio primitives. This enables a long line of interesting applications, including generating new jazz improvisations or new a-cappella rap variants based on a single short example, producing coherent modifications to famous songs (e.g. adding a new verse to a Beatles song based solely on the original recording), filling-in of missing parts (inpainting), extending the bandwidth of a speech signal (super-resolution), and enhancing old recordings without access to any clean training example. We show that in all cases, no more than 20 seconds of training audio commonly suffice for our model to achieve state-of-the-art results. This is despite its complete lack of prior knowledge about the nature of audio signals in general.
研究动机与目标
- 开发一种生成模型,仅从一个简短的音频示例中学习音频统计特性,无需大规模数据集或外部监督。
- 实现在语义上与输入相似但多样化的音频生成,包括新的即兴创作、歌曲的改编版本以及信号增强。
- 证明仅用20秒音频进行训练即可在音频补全和带宽扩展等任务中超越使用数小时数据训练的模型。
- 在无清洁或配对训练数据的情况下,实现音频补全、超分辨率和去噪等应用。
- 探索从极少量数据中学习复杂音频结构的可行性,挑战大规模数据集对音频生成必不可少的假设。
提出的方法
- 模型采用多尺度原始波形 GAN 架构,直接在时域生成波形,避免使用频谱或潜在空间表示。
- 采用多尺度判别器,在不同时间分辨率下强制保证感知质量,并根据信号特性自适应选择特征金字塔层级。
- 训练目标包含重建损失,鼓励生成器在噪声假设下重建输入波形,从而实现自监督去噪。
- 模型在单个简短原始音频片段(如20秒)上端到端训练,无需预训练或外部监督。
- 通过将生成器条件化于输入的低频分量,实现条件生成,从而对生成输出的结构进行控制。
- 架构中引入自适应损失加权和噪声注入,以稳定训练并提升样本多样性。
实验结果
研究问题
- RQ1深度生成模型能否在无任何外部监督的情况下,仅从一个极短音频示例(如20秒)中学习到有意义的音频统计特性?
- RQ2在音频补全和超分辨率等任务中,仅用一个示例训练是否能优于在大规模数据集上训练的模型?
- RQ3该模型能否在缺乏语言或和声结构的情况下,生成语义连贯且感知真实的多样化音频样本?
- RQ4在无清洁训练数据的情况下,该模型在自监督去噪方面能达到何种程度?
- RQ5该模型能否仅基于一次录音,生成新的音乐即兴创作或现有歌曲的改编版本?
主要发现
- 仅使用20秒训练数据,该模型在音频补全和带宽扩展任务中达到最先进性能,优于在8小时数据上训练的模型。
- 在用户偏好研究中,50%的情况下受试者更偏好 CAW 生成的音频补全结果,且对 CAW 生成结果与真实信号的偏好依然很高,表明其具有高度的感知真实性。
- 在去噪任务中,CAW 在合成带噪录音(白噪声和留声机噪声)上将信噪比(SNR)提升了1.5–4 dB,分别在5 dB SNR时获得4.78 dB和1.56 dB的增益。
- 该模型在无任何干净参考的情况下成功去噪了历史录音(如1903年的小提琴录音),生成结果在感知上比原始录音更清晰。
- 尽管数据极少,该模型仍能从单个20秒示例中生成多样且结构一致的样本,如新的爵士即兴演奏和无伴奏说唱变体。
- 该模型在不同领域(包括语音、音乐和器乐录音)中表现稳健,无需针对特定领域进行适应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。