Skip to main content
QUICK REVIEW

[論文レビュー] ObjectStitch: Generative Object Compositing

Yizhi Song, Zhifei Zhang|arXiv (Cornell University)|Dec 2, 2022
Generative Adversarial Networks and Image Synthesis被引用数 10
ひとこと要約

本論文では、幾何補正、色調調整、影の合成、ビュー合成を1つのフレームワークで統合する自己教師付き拡散モデル、ObjectStitchを提案する。画像ガイドド生成のためのコンテンツアダプタを導入し、データ拡張を活用することで、手動アノテーションを一切不要とし、実世界の画像におけるユーザー研究でも最先端のリアルさと外観忠実度を達成した。

ABSTRACT

Object compositing based on 2D images is a challenging problem since it typically involves multiple processing stages such as color harmonization, geometry correction and shadow generation to generate realistic results. Furthermore, annotating training data pairs for compositing requires substantial manual effort from professionals, and is hardly scalable. Thus, with the recent advances in generative models, in this work, we propose a self-supervised framework for object compositing by leveraging the power of conditional diffusion models. Our framework can hollistically address the object compositing task in a unified model, transforming the viewpoint, geometry, color and shadow of the generated object while requiring no manual labeling. To preserve the input object's characteristics, we introduce a content adaptor that helps to maintain categorical semantics and object appearance. A data augmentation method is further adopted to improve the fidelity of the generator. Our method outperforms relevant baselines in both realism and faithfulness of the synthesized result images in a user study on various real-world images.

研究の動機と目的

  • 色調、照明、影の調整に手動チューニングを要する従来の合成パイプラインに起因する限界を解消すること。
  • 訓練データに対して高価でタスク特化されたアノテーションを排除し、完全に自己教師付き学習を可能にすること。
  • 視点変換、幾何補正、色調調整、影生成といった複数の合成側面を1つの生成モデルに統合すること。
  • テキストプロンプトではなく画像ガイドド拡散を用いることで、入力オブジェクトのアイデンティティと外観を保存すること。
  • 自己教師付き設定下で、新規のコンテンツアダプタとデータ拡張技術を活用して生成忠実度を向上させること。

提案手法

  • フレームワークは、入力オブジェクト画像、ターゲット背景、挿入位置を指定するバウンディングボックスによって誘導される条件付き拡散モデルを用いる。
  • コンテンツアダプタモジュールは、入力オブジェクトからマルチモodalな埋め込みを抽出し、高レベルの意味的特徴と低レベルの詳細(色や形状)を画像ガイドド生成に統合する。
  • 生成モジュールは、背景の文脈を保持しつつ、反復的ノイズ除去によってリアルさを向上させる合成画像を生成する。
  • 合成データ生成とデータ拡張(クロップおよびシフト拡張を含む)を用いて、完全に自己教師付きでモデルを訓練する。
  • コンテンツアダプタは2段階で訓練される:まず非適応的埋め込みを学習し、その後インスタンスレベル特徴でそれを精緻化することで外観保持を向上させる。
  • 評価には修正済みCLIPスコアが用いられ、テキストガイドド(CLIPテキストスコア)と画像ガイドド(CLIP画像スコア)の両方の意味的一致を別々に測定する。

実験結果

リサーチクエスチョン

  • RQ1タスク特化された監視なしに、幾何補正、色調調整、影の合成、ビュー合成といった複数の合成タスクを1つの拡散モデルが効果的に統合できるか?
  • RQ2画像ガイドド拡散モデルは、テキストガイドド代替手法と比較して、合成におけるオブジェクトのアイデンティティと外観をどれほどよく保持できるか?
  • RQ3コンテンツアダプタモジュールは、合成のための画像生成において、忠実度と外観保持にどれほど寄与するか?
  • RQ4データ拡張技術は、自己教師付き合成モデルにおけるリアルさと詳細の向上にどれほど効果的か?
  • RQ5自己教師付き事前学習とマルチステージ適応は、生成的合成モデルの性能にどのような影響を与えるか?

主な発見

  • 実世界の画像におけるユーザー研究で、ObjectStitchはBLIP や SDEdit といったテキストガイドドベースラインを上回り、外観保持性とリアルさに優れた。
  • コンテンツアダプタは生成忠実度と意味的整合性を顕著に向上させ、アブレーション実験ではBLIPに置き換えた場合にCLIP画像スコアが著しく低下した。
  • コンテンツアダプタを削除するか、2段階目の訓練ステージを飛ばすと性能が劣化し、インスタンスレベル特徴を学習する役割を確認した。
  • データ拡張、特にクロップおよびシフト拡張はマスク領域カバレッジを向上させ、詳細忠実度を高めるが、これを省略するとリアルさが顕著に低下した。
  • FIDスコアとCLIP画像スコアの両方で最先端の結果を達成し、入力オブジェクトとの優れたリアルさと意味的整合性を示した。
  • フレームワークは、マスク領域内に影と幾何補正を効果的に合成できたが、マスキング制約のため、全体的な影伝播などのグローバル効果は限定的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。