[論文レビュー] Interpolating between Images with Diffusion Models
本稿では、事前学習済みの潜在拡散モデルを用いたゼロショット画像補間手法を提案し、多様なスタイル、レイアウト、被写体を有する実画像間で高品質で意味的に整合性のある遷移を実現する。ノイズレベルを徐々に低下させながら潜在空間で補間し、補間されたテキスト埋め込みとオプションのポーズガイドランスを条件付けすることで、視覚的に整合性のある動画シーケンスを生成する。FID や PPL といった標準的評価指標は、創造的で意味的な変換を好まないが、本手法はそれらを上回る性能を示す。
One little-explored frontier of image generation and editing is the task of interpolating between two input images, a feature missing from all currently deployed image generation pipelines. We argue that such a feature can expand the creative applications of such models, and propose a method for zero-shot interpolation using latent diffusion models. We apply interpolation in the latent space at a sequence of decreasing noise levels, then perform denoising conditioned on interpolated text embeddings derived from textual inversion and (optionally) subject poses. For greater consistency, or to specify additional criteria, we can generate several candidates and use CLIP to select the highest quality image. We obtain convincing interpolations across diverse subject poses, image styles, and image content, and show that standard quantitative metrics such as FID are insufficient to measure the quality of an interpolation. Code and data are available at https://clintonjwang.github.io/interpolation.
研究の動機と目的
- スタイル、コンテンツ、レイアウトに大きな差がある実画像間で、高品質で意味的に整合性のある補間を可能にすること。これは現在の画像生成パイプラインに欠けている機能である。
- 特に顔など限定ドメイン外の実画像に対して、ユーザーの制御性と一貫性に欠ける既存の補間手法の課題を解決すること。
- 微調整を伴わずに事前学習済みの潜在拡散モデルを活用する方法を開発し、多様な画像ペアに即座に適用可能なゼロショットデプロイメントを実現すること。
- FID や PPL といった標準的評価指標が、補間の知覚的品質や創造性を捉えられていないことの証明を行い、新たな評価パラダイムの必要性を示すこと。
提案手法
- 拡散プロセスにおける複数のノイズレベルで、2枚の入力画像の潜在表現を補間し、均等または非均等なスケジュールを用いて知覚的遷移速度を制御する。
- テキストインバージョンを介して得られる補間されたテキスト埋め込みを、ノイズ除去 U-Net の条件付けに用いることで、フレーム間での意味的整合性を確保する。
- 被写体のポーズ埋め込みをオプションで組み込むことで、特に人間や人間くずの被写体において構造的整合性を維持する。
- 異なるノイズベクトルを用いて各フレームごとに複数の候補補間を生成し、望ましいプロンプトとの CLIP類似度を用いて最高品質の出力を選択する。
- 段階的なノイズ除去戦略を採用する——中間のタイムステップで補間を行い、反復的にノイズ除去することで滑らかさと意味的忠実度を向上させる。
- 補間の前に潜在変数にアフィン変換を適用することで、ズームやパンなどの動き効果を再現し、動画に類似したシーケンスへの応用を拡張する。

実験結果
リサーチクエスチョン
- RQ1事前学習済みの潜在拡散モデルは、微調整なしに、多様なスタイルやレイアウトを持つ実画像間で高品質で意味的に整合性のある補間を生成できるか?
- RQ2補間されたテキストおよびポーズ埋め込みの条件付けが、画像補間の品質および一貫性にどのように影響するか?
- RQ3なぜ FID や PPL といった標準的評価指標が、画像補間タスクにおける人間の好みと相関しないのか?
- RQ4段階的なノイズ除去と CLIP に基づく候補選択は、補間の視覚的品質および整合性を向上させられるか?
- RQ5補間スケジュールの選択(均等 vs. 非均等)が、知覚的滑らかさおよびユーザーが感じる遷移のダイナミクスにどのように影響するか?
主な発見
- 提案手法は、人間から山脈、アニメからフォトリアルな表現、異なるポーズへの変換など、多様な画像ペアにおいて視覚的に説得力のある補間を生成した。特に意味的差が大きい場合でも有効であった。
- 共通のノイズを用いた補間と段階的ノイズ除去(ノイズ追加-補間-ノイズ除去)により、PPL が最も高く(193 ± 27)なったが、FID では最適でないにもかかわらず、質的評価では最も好まれた。
- FID と PPL の評価指標は、単純なアルファブレンドに類似した補間を好む傾向にあり、創造的でない、あるいは急激な変化を示す結果となり、現在の指標が補間品質を適切に評価できていないことを示している。
- CLIP に基づく候補選択により、類似度が低いか一貫性のないフレームをフィルタリングすることで、出力品質が著しく向上し、意味的整合性が強化された。
- 非均等な補間スケジュールは、入力画像付近での急速なスタイル変化に対して、知覚的スピードをよりよく制御でき、ユーザーが遷移ダイナミクスを制御できるようにした。
- 極端なスタイルの不一致や複雑なオブジェクト再編成に対しては一般化に失敗することがあり、ポーズガイドランスがある場合でさえ、余分なテキストを挿入したり、体の部位を誤って対合したりする場合があった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。