Skip to main content
QUICK REVIEW

[論文レビュー] RenderDiffusion: Image Diffusion for 3D Reconstruction, Inpainting and Generation

Titas Anciukevičius, Zexiang Xu|arXiv (Cornell University)|Nov 17, 2022
Generative Adversarial Networks and Image Synthesis被引用数 14
ひとこと要約

RenderDiffusionは、単眼2D画像にのみ微調整された最初の3Dに配慮した拡散モデルを紹介する。ノイズ除去アーキテクチャに潜在的トライプレーン表現と微分可能レンダリングを組み合わせ、3Dの一貫性を強制することで、3D再構築、3Dに配慮した補完、および非条件的な3D生成を可能にする。ShapeNet、CLEVR、FFHQ、AFHQの各データセットで競争力ある性能を示し、明示的な3D監視なしに単眼3D再構築で最先端の結果を達成した。

ABSTRACT

Diffusion models currently achieve state-of-the-art performance for both conditional and unconditional image generation. However, so far, image diffusion models do not support tasks required for 3D understanding, such as view-consistent 3D generation or single-view object reconstruction. In this paper, we present RenderDiffusion, the first diffusion model for 3D generation and inference, trained using only monocular 2D supervision. Central to our method is a novel image denoising architecture that generates and renders an intermediate three-dimensional representation of a scene in each denoising step. This enforces a strong inductive structure within the diffusion process, providing a 3D consistent representation while only requiring 2D supervision. The resulting 3D representation can be rendered from any view. We evaluate RenderDiffusion on FFHQ, AFHQ, ShapeNet and CLEVR datasets, showing competitive performance for generation of 3D scenes and inference of 3D scenes from 2D images. Additionally, our diffusion-based approach allows us to use 2D inpainting to edit 3D scenes.

研究の動機と目的

  • 2D画像にのみ微調整された拡散モデルを用いて、明示的な3D監視を必要とせずに3D生成と推論を可能にすること。
  • ノイズ除去プロセスに潜在的3D表現を埋め込むことで、画像拡散モデルにおける3Dの一貫性の課題に取り組むこと。
  • 2D画像レベルの監視のみで、補完やオブジェクト挿入などの3Dに配慮した編集タスクをサポートすること。
  • 高精細で多様かつ視点一貫性のある3Dシーン生成を実現し、明確な画像品質と効率的なメモリ使用を維持すること。
  • トライプレーンベースの3Dインダクティブバイアスを用いた2Dノイズ除去により、3Dの一貫性が暗黙的に学習可能であることを示すこと。

提案手法

  • モデルは2Dノイズ画像を処理するノイズ除去U-Netを用い、3D幾何と外観をモデル化するための潜在的トライプレーン表現を統合する。
  • トライプレーンエンコーダーがノイズのある2D画像を3Dに配慮した潜在的表現に変換し、微分可能ボリュームレンダリングを用いて2D画像に再レンダリングされる。
  • ノイズ除去プロセスは、ノイズのある入力を元に綺麗な2D画像を再構築することを訓練目標とし、3D表現がすべての視点で一貫性のある3D構造を保証する。
  • 微分可能レンダラーを活用して、3D表現を通じて勾配を逆伝播可能とし、2D監視からのエンドツーエンド学習を可能にする。
  • 訓練時においてカメラの内部パrameter(内パラメータ)と外部パラメータ(外パラメータ)へのアクセスを仮定し、それらを用いてトライプレーン表現をグローバル3D座標系に整列する。
  • 3Dに配慮した補完のため、モデルは既知の画像領域に条件付けながらマスク領域をサンプリングし、妥当な3D一貫性を持つ完成形を生成する。

実験結果

リサーチクエスチョン

  • RQ12D画像にのみ微調整された拡散モデルが、明示的な3D監視なしに3D一貫性のあるシーンを生成できるか?
  • RQ2微分可能レンダリングを用いた潜在的トライプレーン表現は、画像ノイズ除去プロセスにおける3D一貫性の強制にどの程度有効か?
  • RQ32D拡散モデルは、3D監視付き手法と比較して、競争力ある正確さで単眼3D再構築を実現できるか?
  • RQ42D画像補完は、3Dに配慮した拡散モデルを用いて3Dに配慮したシーン補完に拡張可能か?
  • RQ5トライプレーンレンダリングによる3Dインダクティブバイアスは、2Dのみの拡散モデルと比較して、3D生成の一般化性と多様性を向上させるか?

主な発見

  • RenderDiffusionは、3つのShapeNetクラスのうち2つでEG3Dを上回る、競争力ある単眼3D再構築性能を達成した。
  • モデルは1枚の2D画像から多様で現実的で、一貫性のある幾何と妥当な影を持つ3Dシーンを生成した。
  • このモデルを用いた3Dに配慮した補完は、このタスクに明示的に訓練されていなくても、多様で妥当なマスク領域の完成形を生成した。
  • FFHQおよびAFHQでは、3D一貫性があり視点制御可能な画像を生成したが、大きな方位角角度で若干のアーティファクトが観察された。
  • 2D監視のみで学習された最先端の単眼3D再構築手法よりも、再構築精度が向上した。
  • モデルは、トライプレーンベースの3Dインダクティブバイアスを用いた2Dノイズ除去により、3D一貫性を暗黙的に学習可能であることを示した。これにより、2Dデータからの3Dに配慮した生成と編集が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。