Skip to main content
QUICK REVIEW

[論文レビュー] OBJECT 3DIT: Language-guided 3D-aware Image Editing

Oscar Michel, Anand Bhattad|arXiv (Cornell University)|Jul 20, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

この論文では、物体の平行移動、回転、挿入、削除といった物理的に妥当な正確な編集を、シーンの幾何構造、照明、影を保持したまま実現できる、言語誘導型の3次元認識画像編集フレームワークである OBJECT 3DIT を紹介する。400,000例の手続き的生成された3次元シーンから構成される合成データセット(OBJect)で訓練された3DITは、実世界の画像に対しても効果的に一般化し、定量的指標および人間評価の両面でベースラインを上回り、全タスクで70%を超える好ましさの割合を示した。

ABSTRACT

Existing image editing tools, while powerful, typically disregard the underlying 3D geometry from which the image is projected. As a result, edits made using these tools may become detached from the geometry and lighting conditions that are at the foundation of the image formation process. In this work, we formulate the newt ask of language-guided 3D-aware editing, where objects in an image should be edited according to a language instruction in context of the underlying 3D scene. To promote progress towards this goal, we release OBJECT: a dataset consisting of 400K editing examples created from procedurally generated 3D scenes. Each example consists of an input image, editing instruction in language, and the edited image. We also introduce 3DIT : single and multi-task models for four editing tasks. Our models show impressive abilities to understand the 3D composition of entire scenes, factoring in surrounding objects, surfaces, lighting conditions, shadows, and physically-plausible object configurations. Surprisingly, training on only synthetic scenes from OBJECT, editing capabilities of 3DIT generalize to real-world images.

研究の動機と目的

  • 既存の画像編集ツールが背後にある3次元シーンの幾何構造や照明を無視するという限界に対処すること。
  • 物体の配置、表面、影、照明といった3次元シーンの文脈を尊重する言語誘導型3次元認識画像編集という新しいタスクを導入すること。
  • 3D認識編集モデルの訓練と評価を支援するため、40万件の編集例を含む大規模な手続き的生成データセット(OBJect)を構築すること。
  • 言語条件付きの拡散モデルとしての3DITを設計・訓練し、4つの物体編集タスク(平行移動、回転、挿入、削除)を実行すること。
  • 合成された3次元シーンでのみ訓練されたモデルが、実世界の画像に対しても効果的に一般化でき、シーンに整合した実用的な編集を可能にすることを示すこと。

提案手法

  • 著者らは、Objaverse および Blender を用いて手続き的に生成された3次元シーンから得られる40万件の画像編集ペアを含むデータセットである OBJect を作成した。照明、表面、物体配置を制御可能にしている。
  • 各例には、元の画像、4つの編集操作(平行移動、回転、挿入、削除)のうち1つを説明する自然言語の指示、および正解となる編集済み画像が含まれる。
  • 3DIT は Zero-1-to-3 拡散モデルから初期化され、3段階の学習カリキュラム(ウェブ規模の事前学習、3次元認識事前学習、タスク固有の微調整)を用いて OBJect データセットで微調整された。
  • モデルは単一タスクおよびマルチタスクの両方のバージョンをサポートしており、統一されたアーキテクチャを用いて4つの編集操作を同時に予測可能である。
  • 編集中に物体のスケール、視点、表面接触、影のダイナミクスを保持することで、3次元シーンの一貫性を明示的にモデル化している。
  • 幾何的・照明的一致性の評価には、定量的指標(忠実度、リアリズム)と人間の好みの研究を併用している。
Figure 1: Scene generation in OBJect depicting camera constraints, directional lighting (environment and three-point lighting not shown), and the resulting object shadows.
Figure 1: Scene generation in OBJect depicting camera constraints, directional lighting (environment and three-point lighting not shown), and the resulting object shadows.

実験結果

リサーチクエスチョン

  • RQ1合成された3次元シーンでのみ訓練されたモデルが、実世界の画像に対して現実的で3次元的一致性を持つ画像編集を実行できるか?
  • RQ2言語条件付きの拡散モデルが、物体のスケール、影、隠蔽などの3次元シーンの特性を、物体編集中にどれほど正確に保持できるか?
  • RQ33DIT が物体の平行移動、回転、挿入、削除の各タスクにおいて、幾何的・照明的一致性を維持する点で、既存のベースラインをどの程度上回るか?
  • RQ41つのマルチタスク 3DIT モデルが、顕著な性能低下を伴わずに、4つのすべての編集タスクを効果的に処理できるか?
  • RQ5人間のアノテーターは、幾何的・照明的一致性の観点から、3DIT の出力とベースラインを比較してどの程度高く評価するか?

主な発見

  • 平行移動タスクにおいて、3DIT は幾何的一致性で73.3%、照明的一致性で80.0%の好ましさスコアを達成し、ベースラインを顕著に上回った。
  • 削除タスクでは、幾何的一致性と照明的一致性の両方で86.6%の好ましさスコアを記録し、隠蔽と影の処理が優れていることを示した。
  • 回転タスクでは、幾何的一致性で80.0%、照明的一致性で73.3%の好ましさスコアを達成し、正確な回転と影のレンダリングが可能であることを示した。
  • マルチタスク版の3DIT は、4つのタスクすべてで良好な性能を発揮し、編集タイプ間でのパラメータ共有が効果的であることを示した。
  • 合成データでのみ学習されたにもかかわらず、3DIT は実世界の画像へ効果的に一般化し、一貫性のある影とシーン構造を持つ写真のようにリアルな出力を生成した。
  • 物体を削除または再配置する際、3DIT は以前に隠れていた領域を適切に補完し、シーンの一貫性を保った。
Figure 2: Generated examples from 3DIT as well as baselines for each of the four tasks in the OBJect benchmark.
Figure 2: Generated examples from 3DIT as well as baselines for each of the four tasks in the OBJect benchmark.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。