Skip to main content
QUICK REVIEW

[論文レビュー] Parallel and Flexible Sampling from Autoregressive Models via Langevin Dynamics

Vivek Jayaram, John Thickstun|arXiv (Cornell University)|May 17, 2021
Speech and Audio Processing被引用数 8
ひとこと要約

本稿では、滑らかなグローバル対数尤度上でのランジュバンダイナミクスを用いた、並列的で柔軟な(PnF)サンプリングを提案する。これにより、逐次的でない、条件付き、制約付きの生成が可能になる。この手法は、音声および画像修復タスク(音源分離、スーパーレゾリューション、インpaintingなど)において、シーケンス長に依存しないサンプリング速度と、デバイス間でのスケーラビリティを備えた競争力ある性能を達成する。

ABSTRACT

This paper introduces an alternative approach to sampling from autoregressive models. Autoregressive models are typically sampled sequentially, according to the transition dynamics defined by the model. Instead, we propose a sampling procedure that initializes a sequence with white noise and follows a Markov chain defined by Langevin dynamics on the global log-likelihood of the sequence. This approach parallelizes the sampling process and generalizes to conditional sampling. Using an autoregressive model as a Bayesian prior, we can steer the output of a generative model using a conditional likelihood or constraints. We apply these techniques to autoregressive models in the visual and audio domains, with competitive results for audio source separation, super-resolution, and inpainting.

研究の動機と目的

  • 自己回帰的モデルにおけるアンセストラルサンプリングの遅さと逐次性が、高解像度音声および画像生成の実用的利用を制限する問題に対処すること。
  • 再訓練や自己回帰的要因分解の逆転なしに、インpainting、スーパーレゾリューション、音源分離といった柔軟な条件付きサンプリングを可能にすること。
  • 並列化可能で計算リソースに応じて効率的にスケーリングできるサンプリング手法を開発し、ウォールクロック時間を短縮すること。
  • 条件付き尤度や制約を組み込むことで、自己回帰的モデルをベイジアン逆問題の事前分布として一般化すること。
  • PnFサンプリングが、生成品質を競争力ある水準に保ちつつ、新たな条件付きサンプリングの可能性を実現することを示すこと。

提案手法

  • 全シーケンスをランダムノイズで初期化し、そのシーケンスのグローバル対数尤度上でのランジュバンダイナミクスにより進化させるPnFサンプラーを提案する。
  • 離散的自己回帰的モデルの対数尤度を微分可能かつ連続最適化に適した形にするために、ガウス畳み込みを用いた平滑化技術を適用する。
  • 滑らかさ温度を段階的に低下させるアニーリングスケジュールを用い、マルコフ連鎖をターゲット分布に導く。
  • スケーラブルな分散サンプリングを実現するため、確率的勾配ランジュバンダイナミクス(SGLD)にこの手法を拡張する。
  • 自己回帰的モデル(例:WaveNet、PixelCNN++)を事前分布として用い、後方分布サンプリングプロセスに条件付き尤度や制約を統合する。
  • 適切な観測モデルを定義することで、音源分離、スーパーレゾリューション、インpaintingといった線形逆問題にこの手法を適用する。

実験結果

リサーチクエスチョン

  • RQ1滑らかなグローバル対数尤度上でのランジュバンダイナミクスは、逐次的依存性なしに自己回帰的モデルからの並列サンプリングを可能にするか?
  • RQ2PnFサンプリングは、再訓練や自己回帰的順序の逆転なしに、インpainting やスーパーレゾリューションといった条件付き生成タスクに一般化可能か?
  • RQ3PnFサンプリングは、ウォールクロック時間を短縮しつつ、アンセストラルサンプリングと同等の生成品質を達成するか?
  • RQ4計算デバイスの数に応じて、この手法は効率的にスケーリングされ、ほぼ線形の高速化が達成できるか?
  • RQ5PnFサンプリングは、音源分離やスーパーレゾリューションといった実世界の音声および画像修復タスクにおいて、どれほど高い性能を発揮するか?

主な発見

  • ピアノデータにおける4倍音声スーパーレゾリューションでは、PnFサンプリングがPSNR 29.78を達成し、KEEベースライン(22.25)およびスプライン補間(23.07)を上回った。
  • 16倍スーパーレゾリューションでは、ピアノデータでPnFがPSNR 14.23を達成し、KEEベースライン(6.76)を著しく上回り、従来手法を超える可能性を示した。
  • CIFAR-10における画像音源分離タスクで、PixelCNN++を用いたPnFはクラススプリット設定でFID 40.66を達成し、最先端のBASIS(Glow)手法(FID 40.21)と同等の性能を示した。
  • クラスアンノウン設定では、PnFがPixelCNN++を用いてFID 37.89を達成し、BASIS(NCSN)ベースライン(FID 29.92)に近く、より単純な事前分布でも強力な性能を示した。
  • PnFサンプリングは、高品質な音声インpaintingおよび32倍スーパーレゾリューションを実現し、定性的な結果から、既存のベースラインを上回る明確な知覚的品質を示した。
  • 確率的PnFサンプリングは、計算時間とデバイス数が逆比例する関係を達成し、スケーラブルで並列なサンプリングを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。