Skip to main content
QUICK REVIEW

[論文レビュー] Alleviating Exposure Bias in Diffusion Models through Sampling with Shifted Time Steps

Mingxiao Li, Tingyu Qu|arXiv (Cornell University)|May 24, 2023
Generative Adversarial Networks and Image Synthesis被引用数 6
ひとこと要約

本稿では、推論中に現在の時刻ステップの周囲のウィンドウ内で、より良好に適合するノイズ除去ステップを動的に選択することにより、訓練なしで拡散モデルにおける露出バイアスを軽減するための Time-Shift Sampler を提案する。この手法により、FIDスコアが顕著に向上し、10ステップでのCIFAR-10では3.88のFIDを達成し、F-PNDMよりも44.49%の改善を示し、100ステップを要するヴァーチャルDDIMをも上回る。

ABSTRACT

Diffusion Probabilistic Models (DPM) have shown remarkable efficacy in the synthesis of high-quality images. However, their inference process characteristically requires numerous, potentially hundreds, of iterative steps, which could exaggerate the problem of exposure bias due to the training and inference discrepancy. Previous work has attempted to mitigate this issue by perturbing inputs during training, which consequently mandates the retraining of the DPM. In this work, we conduct a systematic study of exposure bias in DPM and, intriguingly, we find that the exposure bias could be alleviated with a novel sampling method that we propose, without retraining the model. We empirically and theoretically show that, during inference, for each backward time step $t$ and corresponding state $\hat{x}_t$, there might exist another time step $t_s$ which exhibits superior coupling with $\hat{x}_t$. Based on this finding, we introduce a sampling method named Time-Shift Sampler. Our framework can be seamlessly integrated to existing sampling algorithms, such as DDPM, DDIM and other high-order solvers, inducing merely minimal additional computations. Experimental results show our method brings significant and consistent improvements in FID scores on different datasets and sampling methods. For example, integrating Time-Shift Sampler to F-PNDM yields a FID=3.88, achieving 44.49\% improvements as compared to F-PNDM, on CIFAR-10 with 10 sampling steps, which is more performant than the vanilla DDIM with 100 sampling steps. Our code is available at https://github.com/Mingxiao-Li/TS-DPM.

研究の動機と目的

  • 訓練(汚染された真値を使用)と推論(モデルが予測したサンプルを使用)の間の不一致に起因する拡散確率的モデル(DPMs)における露出バイアス問題を調査・解決すること。
  • モデルの再訓練を伴わず露出バイアスを軽減するサンプリング手法を開発することにより、再訓練に伴う高い計算コストを回避すること。
  • サンプリング中に現在のノイズ除去状態とより優れた適合性を示す時刻ステップを特定することで、サンプル品質の向上と推論効率の向上を図ること。
  • DDPM、DDIM、F-PNDMなどの既存のサンプリングアルゴリズムと互換性があり、最小限の計算コストで統合可能なプラグアンドプレイソリューションを提供すること。

提案手法

  • 各ノイズ除去ステップにおいて、現在の状態 $ \hat{x}_t $ とより良好に適合する代替時刻ステップ $ t_s $ を、ウィンドウ $[t - w/2, t + w/2]$ 内で探索する、新しいサンプリング戦略である Time-Shift Sampler を提案する。
  • 探索を制御するためのカットオフ時刻ステップ $ t_c $ を導入:$ t > t_c $ の場合、時間シフト探索を実行する。$ t \leq t_c $ の場合、元の時刻ステップを使用し、ノイズ除去の自然な進行に沿わせる。
  • 実験的に、最適な次回時刻ステップが、現在のサンプルの予測分散と相関していることが判明し、$ t_s $ のデータ駆動的選択が可能になる。
  • DDPM、DDIM、F-PNDM などの既存のサンプリングアルゴリズムに、わずかな修正でシームレスに統合可能であり、計算コストは無視できるほど小さい。
  • 理論的分析により、最適な次回時刻ステップの分散を導出し、時間シフト選択メカニズムに原理的根拠を与える。
  • 探索空間を制限し安定性を向上させるためのウィンドウド検索戦略を採用し、ウィンドウサイズはサンプリングステップ数に応じて調整される。

実験結果

リサーチクエスチョン

  • RQ1モデルの再訓練を伴わず、拡散モデルにおける露出バイアスを軽減できるか?
  • RQ2現在のノイズ除去状態 $ \hat{x}_t $ とより優れた適合性を示す時刻ステップ $ t_s $ が存在するか、それがサンプル品質の向上に寄与するか?
  • RQ3推論時の時刻ステップの選択が、生成画像の品質および一貫性にどのように影響するか?
  • RQ4訓練なしで、プラグアンドプレイ可能なサンプリング手法が、さまざまなサンプリングアルゴリズムやデータセットで一貫した改善を達成できるか?
  • RQ5現在の状態とその予測分散を踏まえて、ノイズ除去の次の時刻ステップを最適に選択する戦略は何か?

主な発見

  • Time-Shift Sampler は、現在のノイズ除去状態 $ \hat{x}_t $ とより良好に適合する時刻ステップ $ t_s $ を選択することで、再訓練を伴わず露出バイアスを軽減し、サンプル品質を向上させる。
  • CIFAR-10 で10ステップのサンプリングのみを用いて、F-PNDM に Time-Shift Sampler を統合した場合、FID スコアは 3.88 を達成し、元の F-PNDM と比べて44.49%の改善を示した。
  • 100ステップを要するヴァーチャルDDIMをも上回り、はるかに少ないステップ数で優れたFID(3.88 vs. 4.04)を達成した。
  • 10〜50ステップではウィンドウサイズの選択に頑健であるが、100ステップではステップサイズが細かくなり、予測精度が高いため、より敏感になる。
  • CIFAR-10 における最適なカットオフ時刻ステップ $ t_c $ は [200, 400] の範囲にあり、特に少ないサンプリングステップ数を用いる場合、小さい値(例:200)が好ましい。
  • Time-Shift Sampler は DDPM、DDIM、S-PNDM、F-PNDM など複数のサンプリングアルゴリズムと互換性があり、すべてのアルゴリズムで一貫して顕著な向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。