Skip to main content
QUICK REVIEW

[论文解读] Parallel and Flexible Sampling from Autoregressive Models via Langevin Dynamics

Vivek Jayaram, John Thickstun|arXiv (Cornell University)|May 17, 2021
Speech and Audio Processing被引用 8
一句话总结

本文提出了一种基于平滑全局对数似然的Langevin动力学的并行灵活(PnF)采样方法,用于自回归模型,实现了并行、条件化及基于约束的生成。该方法在音频和图像修复任务(如源分离、超分辨率和图像修复)中表现出色,采样速度与序列长度无关,并可在多设备间高效扩展。

ABSTRACT

This paper introduces an alternative approach to sampling from autoregressive models. Autoregressive models are typically sampled sequentially, according to the transition dynamics defined by the model. Instead, we propose a sampling procedure that initializes a sequence with white noise and follows a Markov chain defined by Langevin dynamics on the global log-likelihood of the sequence. This approach parallelizes the sampling process and generalizes to conditional sampling. Using an autoregressive model as a Bayesian prior, we can steer the output of a generative model using a conditional likelihood or constraints. We apply these techniques to autoregressive models in the visual and audio domains, with competitive results for audio source separation, super-resolution, and inpainting.

研究动机与目标

  • 为解决自回归模型中祖先采样固有的缓慢串行特性,该特性限制了其在高分辨率音频和图像生成中的实际应用。
  • 在不重新训练模型或反转自回归因子分解的前提下,实现灵活的条件采样(如图像修复、超分辨率和源分离)。
  • 开发一种可并行化且能随计算资源高效扩展的采样方法,以减少实际运行时间。
  • 通过引入条件似然或约束,将自回归模型推广为贝叶斯逆问题中的先验。
  • 证明PnF采样在保持高性能生成质量的同时,实现了新型条件采样能力。

提出的方法

  • 提出一种PnF采样器,通过随机噪声初始化完整序列,并在序列的全局对数似然上利用Langevin动力学进行演化。
  • 采用高斯卷积技术对离散自回归模型的对数似然进行平滑处理,使其具备可微性,适用于连续优化。
  • 采用退火调度策略,逐步降低平滑温度,引导马尔可夫链收敛至目标分布。
  • 将方法扩展至随机梯度Langevin动力学(SGLD),实现在多台设备上无依赖的、可轻松并行化的分布式采样。
  • 使用自回归模型(如WaveNet、PixelCNN++)作为先验,并将条件似然或约束整合到后验采样过程中。
  • 通过定义适当的观测模型,将该方法应用于线性逆问题,如源分离、超分辨率和图像修复。

实验结果

研究问题

  • RQ1在平滑的全局对数似然上应用Langevin动力学,是否能实现自回归模型的无串行依赖并行采样?
  • RQ2PnF采样是否能在不重新训练或反转自回归顺序的前提下,推广至图像修复和超分辨率等条件生成任务?
  • RQ3PnF采样在生成质量上是否与祖先采样相当,同时显著减少实际运行时间?
  • RQ4该方法是否能随计算设备数量高效扩展,实现近似线性加速?
  • RQ5PnF采样在真实世界的音频和图像修复任务(如源分离和超分辨率)中表现如何?

主要发现

  • 在钢琴音频4倍超分辨率任务中,PnF采样在PSNR上达到29.78,优于KEE基线(22.25)和样条插值方法(23.07)。
  • 在16倍超分辨率任务中,PnF在钢琴数据上达到14.23的PSNR,显著优于KEE基线(6.76),证明了其在超越以往方法的可行性。
  • 在CIFAR-10图像源分离任务中,PnF结合PixelCNN++在类别分割设置下FID为40.66,与当前最先进方法BASIS(Glow)的FID 40.21相当。
  • 在类别无关设置下,PnF结合PixelCNN++的FID为37.89,接近BASIS(NCSN)基线的FID 29.92,表明其在使用更简单先验时仍具备强大性能。
  • PnF采样实现了高质量的音频修复和32倍超分辨率,定性结果表明其感知质量显著优于现有基线。
  • 随机PnF采样在计算时间与设备数量成反比的前提下,达到了祖先采样的生成质量,实现了可扩展的并行采样。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。