Skip to main content
QUICK REVIEW

[論文レビュー] CustomNet: Zero-shot Object Customization with Variable-Viewpoints in Text-to-Image Diffusion Models

Ziyang Yuan, Mingdeng Cao|arXiv (Cornell University)|Oct 30, 2023
Generative Adversarial Networks and Image Synthesis被引用数 4
ひとこと要約

CustomNetは、テキストから画像への拡散モデルにおけるオブジェクトカスタマイズのためのゼロショット手法を提示する。3D新視点合成を活用することで、オブジェクトの視点、位置、背景に対する明示的な制御を可能にし、テスト時の最適化なしに多様で調和のとれた出力を実現するとともに、顔貌の保持を強化する。本手法は、視点条件付き生成、テクスチャ保持のための入力連結、分離された前景・背景制御のための二重クロスアテンションを組み合わせる。

ABSTRACT

Incorporating a customized object into image generation presents an attractive feature in text-to-image generation. However, existing optimization-based and encoder-based methods are hindered by drawbacks such as time-consuming optimization, insufficient identity preservation, and a prevalent copy-pasting effect. To overcome these limitations, we introduce CustomNet, a novel object customization approach that explicitly incorporates 3D novel view synthesis capabilities into the object customization process. This integration facilitates the adjustment of spatial position relationships and viewpoints, yielding diverse outputs while effectively preserving object identity. Moreover, we introduce delicate designs to enable location control and flexible background control through textual descriptions or specific user-defined images, overcoming the limitations of existing 3D novel view synthesis methods. We further leverage a dataset construction pipeline that can better handle real-world objects and complex backgrounds. Equipped with these designs, our method facilitates zero-shot object customization without test-time optimization, offering simultaneous control over the viewpoints, location, and background. As a result, our CustomNet ensures enhanced identity preservation and generates diverse, harmonious outputs.

研究の動機と目的

  • 最適化ベースおよびエンコーダベースのカスタマイズ手法の限界に対処する。具体的には、推論が遅い、アイデンティティの保持が不十分、コピー&ペーストアーチファクトが生じる問題を改善する。
  • 現在の3D新視点合成手法をオブジェクトカスタマイズに応用する際の視点の多様性不足と空間的制御の欠如を克服する。
  • テキスト的または画像ベースの条件によって、オブジェクトの視点、空間的位置、背景を同時に制御可能にする。
  • 実世界のオブジェクトと複雑な背景を訓練プロセスに効果的に統合するデータ構築パイプラインを開発する。
  • 事前学習済みの3D視点合成能力を活用することで、テスト時の最適化なしにゼロショットカスタマイズを実現する。

提案手法

  • Zero-1-to-3にインspiredされた視点条件付き拡散モデリングを用いて、3D新視点合成をオブジェクトカスタマイズパイプラインに統合する。
  • カメラポーズパラメータ $[R, T]$ を用いて明示的な視点制御を可能にし、1枚の参照画像から多様なオブジェクトビューを生成する。
  • 変換された参照オブジェクト画像をUNetの入力に直接連結することで、空間的位置の制御を実現する。
  • 前景と背景の制御を分離する二重クロスアテンションモジュールを導入し、テキストプロンプトまたはユーザーが提供する背景画像に対して独立した条件付けを可能にする。
  • 合成マルチビュー画像(Objaverse)と自然画像(OpenImages)を組み合わせたカスタムデータ構築パイプラインを活用し、リアリズムと一般化性能を向上させる。
  • 事前学習済みのZero-1-to-3の重みでCustomNetを初期化することで、視点の一貫性とアイデンティティを初期段階から保持する。

実験結果

リサーチクエスチョン

  • RQ13Dに意識的な拡散モデルにおける明示的な視点制御は、ゼロショットオブジェクトカスタマイズにおける多様性とアイデンティティ保持を向上させるか?
  • RQ2参照オブジェクト画像の入力連結は、生成画像におけるテクスチャおよびアイデンティティ保持にどのように影響するか?
  • RQ3二重クロスアテンションは、視点の一貫性を保ちつつ、前景と背景の分離制御をどの程度可能にするか?
  • RQ4提案されたデータ構築パイプラインは、単純なデータ結合と比較して、実世界のオブジェクトと複雑な背景の処理にどの程度効果的か?
  • RQ5本手法は、テスト時の最適化や微調整なしに、高品質で調和の取れた出力を達成できるか?

主な発見

  • CustomNetは、顔貌保持が強く、従来のエンコーダベース手法で一般的なコピー&ペースト効果を回避する多様で視点が異なる出力を達成する。
  • 明示的な視点制御と参照画像の連結を組み合わせることで、これらの要素を備えないモデルと比較して、テクスチャおよび形状の忠実度が顕著に向上する。
  • 二重クロスアテンションにより、分離された制御が可能である:同じオブジェクトの視点を維持したまま、異なるテキスト的背景記述に対応可能であり、ユーザーが提供する背景もスムーズに統合される。
  • データ構築パイプラインにより、マルチビューのオブジェクトデータと多様な自然背景を組み合わせることで、「浮遊」アーチファクトが効果的に低減され、リアリズムが向上する。
  • 特に事前学習済みの3D視点合成モデル(Zero-1-to-3)から初期化された場合、CustomNetは視点の一貫性とアイデンティティ保持においてベースラインモデルを上回る。
  • 明示的な視点制御がなければ、マルチビューのデータで学習しても、モデルはコピー&ペースト行動に帰着するため、ポーズ条件付けの必要性が明確になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。