Skip to main content
QUICK REVIEW

[论文解读] SampleRNN: An Unconditional End-to-End Neural Audio Generation Model

Soroush Mehri, Kundan Kumar|arXiv (Cornell University)|Dec 22, 2016
Music and Audio Processing被引用 362
一句话总结

SampleRNN 引入一个分层、多速率的 RNN 框架,用以端到端建模原始音频波形,在无条件音频生成方面超越基线,并展示出人类偏好样本。

ABSTRACT

In this paper we propose a novel model for unconditional audio generation based on generating one audio sample at a time. We show that our model, which profits from combining memory-less modules, namely autoregressive multilayer perceptrons, and stateful recurrent neural networks in a hierarchical structure is able to capture underlying sources of variations in the temporal sequences over very long time spans, on three datasets of different nature. Human evaluation on the generated samples indicate that our model is preferred over competing models. We also show how each component of the model contributes to the exhibited performance.

研究动机与目标

  • 推动在不依赖手工特征的情况下对原始音频进行无条件生成。
  • 开发能够捕捉长程时间结构的多层 RNN 架构。
  • 在多样的音频领域进行性能评估(语音、发声、音乐)。
  • 与自回归基线以及类似 WaveNet 的模型进行比较。
  • 证明人类更偏好所提出模型的样本。)

提出的方法

  • 使用自回归框架将音频序列的概率建模为条件概率的乘积。
  • 构建在不同时间分辨率下工作的帧级 RNN 模块层次结构。
  • 使用具有离散输出的样本级 MLP 来建模下一个采样的分布。
  • 通过穿孔上采样将高层条件向量上采样并喂给低层。
  • 采用截断时间反向传播和教师 forcing 进行端到端训练。
  • 将音频量化为 256 个等级,并在样本级 MLP 之前(可选)对输入进行嵌入。

实验结果

研究问题

  • RQ1分层的、多尺度的 RNN 模型是否能比单尺度模型更好地捕捉原始音频中的长程依赖?
  • RQ2帧级建模与样本级建模对无条件音频生成质量的影响是什么?
  • RQ3在多样的音频数据集上,SampleRNN 与 WaveNet 及传统 RNN 基线相比表现如何?
  • RQ4将输出分布离散化(多项式)是否比实值输出提高生成质量?
  • RQ5记忆深度和子序列长度如何影响训练与生成质量?

主要发现

  • SampleRNN(3 层)在 Blizzard、Onomatopoeia 和 Music 数据集上实现强对数似然分数,在多个指标上优于 RNN 和 WaveNet 基线。
  • SampleRNN(2 层)和(3 层)在 Blizzard、Onomatopoeia 和 Music 数据集的测试 NLL 上均超越基线(Blizzard/Music 比较中为 1.392 相对于 1.434/1.480/1.410)。
  • 实值输出变体相对于离散(256-bin)输出表现不佳,离散建模获得更好的似然度。
  • 内存分析显示 SampleRNN 能在几秒内保持说话人身份并在有无间断的情况下维持连贯性。
  • 人类评估偏好强烈倾向于 Blizzard 数据上的 SampleRNN(3 层)样本,相对于竞争模型,在 Music 上也有类似趋势。
  • 子序列长度达到 512 时提高了验证 NLL,表明在 TBPTT 过程中的更长上下文有益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。