Skip to main content
QUICK REVIEW

[論文レビュー] Paint by Example: Exemplar-based Image Editing with Diffusion Models

Binxin Yang, Shuyang Gu|arXiv (Cornell University)|Nov 23, 2022
Generative Adversarial Networks and Image Synthesis被引用数 8
ひとこと要約

本論文は、参照例画像から学習することで、画像の正確で高精細な意味的操作を可能にする、拡散モデルを用いた新規の例示ベースの画像編集フレームワークを提案する。自己教師あり学習、情報ボトルネック、強力なデータ拡張、分類器フリーのガイドランスを活用することで、コピー&ペーストのアーティファクトを回避し、ワンフォワード推論で最先端の性能を達成する。野生の画像においても優れた性能を発揮する。

ABSTRACT

Language-guided image editing has achieved great success recently. In this paper, for the first time, we investigate exemplar-guided image editing for more precise control. We achieve this goal by leveraging self-supervised training to disentangle and re-organize the source image and the exemplar. However, the naive approach will cause obvious fusing artifacts. We carefully analyze it and propose an information bottleneck and strong augmentations to avoid the trivial solution of directly copying and pasting the exemplar image. Meanwhile, to ensure the controllability of the editing process, we design an arbitrary shape mask for the exemplar image and leverage the classifier-free guidance to increase the similarity to the exemplar image. The whole framework involves a single forward of the diffusion model without any iterative optimization. We demonstrate that our method achieves an impressive performance and enables controllable editing on in-the-wild images with high fidelity.

研究の動機と目的

  • 言語で記述しづらい微細な視覚的詳細を捉えることが難しい、テキストガイド付き画像編集の限界を解消すること。
  • ユーザーが例示画像を参照として提供することで、直感的で使いやすい画像編集を可能にすること。
  • 自己教師あり学習における単純なコピー&ペーストという自明な解を回避するため、構造的および意味的制約を導入すること。
  • 反復的最適化を必要とせず、ワンフォワードパスで高品質で多様かつ制御可能な画像編集結果を達成すること。

提案手法

  • 本手法は、ソース画像と例示画像の両方に条件付けられた拡散モデルを採用し、切り取った領域を参照として自己教師あり学習で訓練する。
  • 例示画像をグローバルな埋め込みに圧縮することで情報ボトルネックを適用し、空間的詳細の記憶を防ぎ、コピー&ペーストのアーティファクトを回避する。
  • 訓練中に例示画像に強力なデータ拡張を適用することで、訓練と推論のドメインギャップを低減する。
  • 訓練時に任意形状のマスクを用いることで、現実世界のユーザーのブラシストロークを模倣し、不規則な編集領域への一般化を向上させる。
  • 生成領域と例示画像との類似性を向上させるために、分類器フリーのガイドランスを統合する。これにより、スタイルとコンテンツの忠実度が向上する。
  • 編集プロセス全体をワンフォワードパスで実行し、画像ごとの最適化を必要とせず、リアルタイム推論を実現する。

実験結果

リサーチクエスチョン

  • RQ1例示ベースの画像編集は、微細な画像操作において、テキストガイド付き手法よりも高い忠実度と制御性を達成できるか?
  • RQ2例示ベース編集における自明なコピー&ペースト解を回避するため、自己教師あり学習をどのように設計すべきか?
  • RQ3情報ボトルネックは、拡散モデルにおける意味的理解と空間的記憶の分離にどのような役割を果たすか?
  • RQ4強力なデータ拡張と分類器フリーのガイドランスは、例示ベース編集における一般化性能と視覚的品質をどの程度向上させるか?
  • RQ5反復的最適化に基づく手法と比較して、ワンフォワード推論プロセスが競争力のある結果を達成できるか?

主な発見

  • 提案手法は、すべての変種の中で最小のFIDスコア(1.79)と最大のCLIPスコア(84.97)を達成し、優れた画像品質と参照類似度を示した。
  • アブレーションスタディにより、事前分布、拡張、ボトルネック、分類器フリーのガイドランスのすべての技術を組み合わせた場合に最良の性能が得られ、FIDはベースラインの3.61から3.18に低下した。
  • 分類器フリーのガイドランスは視覚的品質と参照類似度を顕著に向上させ、スケール値が大きい($\lambda = 5$)ほど例示画像に近い結果が得られた。
  • 拡散モデルの確率的性質のおかげで、同じソース画像と例示画像から多様で現実的で、被毛の色や耳の形といった重要なアイデンティティ属性を保持した出力を生成した。
  • FIDスコアはベースライン比44%低下、CLIPスコアは25%向上し、画像品質と一貫性の両面で既存手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。