Skip to main content
QUICK REVIEW

[論文レビュー] Single-Stage Diffusion NeRF: A Unified Approach to 3D Generation and Reconstruction

Hansheng Chen, Jiatao Gu|arXiv (Cornell University)|Apr 13, 2023
Advanced Vision and Imaging被引用数 5
ひとこと要約

SSDNeRFは、マルチビュー画像から1段階の拡散モデルを提案し、NeRFオートデコーダーと3次元潜在拡散事前分布を同時に学習することで、統合的3次元生成と再構成のエンドツーエンド学習を可能にする。これは、3視点からの入力でさえも、非条件的3次元生成および単一/スパarselyビュー再構成において最先端の性能を達成する。

ABSTRACT

3D-aware image synthesis encompasses a variety of tasks, such as scene generation and novel view synthesis from images. Despite numerous task-specific methods, developing a comprehensive model remains challenging. In this paper, we present SSDNeRF, a unified approach that employs an expressive diffusion model to learn a generalizable prior of neural radiance fields (NeRF) from multi-view images of diverse objects. Previous studies have used two-stage approaches that rely on pretrained NeRFs as real data to train diffusion models. In contrast, we propose a new single-stage training paradigm with an end-to-end objective that jointly optimizes a NeRF auto-decoder and a latent diffusion model, enabling simultaneous 3D reconstruction and prior learning, even from sparsely available views. At test time, we can directly sample the diffusion prior for unconditional generation, or combine it with arbitrary observations of unseen objects for NeRF reconstruction. SSDNeRF demonstrates robust results comparable to or better than leading task-specific methods in unconditional generation and single/sparse-view 3D reconstruction.

研究の動機と目的

  • 非条件的生成と画像ベース再構成を含む多様な3次元タスクを統合するフレームワークの開発という課題に対処する。
  • スパarselyビューからの不完全なNeRF再構成に起因するノイズの多い潜在多様体を抱える2段階学習の欠点を克服する。
  • NeRFと拡散モデルのエンドツーエンド学習を可能にし、生成的バイアスとレンダリングバイアスを一貫して融合することで性能を向上させる。
  • 学習済み事前分布を活用して、任意の数の入力ビューから柔軟に3次元再構成を実現するテスト時ガイドランスフィットネススキームを開発する。
  • 3視点という極めて少ない入力でも、従来の手法がアーチファクトの拡散により失敗するようなスパarselyビューデータにおいても、頑健な性能を示す。

提案手法

  • エンドツーエンドの目的関数を用いて、NeRFオートデコーダーの重みと潜在拡散モデルの重みを同時に最適化する1段階の学習パラダイムを提案する。
  • 3次元シーン符号化のためのトライプレーン特徴表現を用い、神経放射場の効率的かつ表現力豊かなモデリングを可能にする。
  • マルチビュー画像から得られるシーンの潜在コードに直接3次元潜在拡散モデルを学習させ、事前学習済みNeRFの必要性を回避する。
  • テスト時に、再構成のための入力ビューに条件づけた拡散事前分布を条件づけるガイドランスフィットネスサンプリングスキームを導入する。
  • 訓練中に早期停止を適用することで、滑らかな潜在事前分布を維持し、スパarselyビュー再構成における一般化性能を向上させる。
  • DDIMベースのサンプリングと球面線形補間を用いて、学習済み事前分布における潜在空間の補間の滑らかさを評価する。

実験結果

リサーチクエスチョン

  • RQ12段階学習が引き起こすアーチファクトを回避する1段階の学習パラダイムを用いて、統合的3次元生成と再構成フレームワークを構築できるか?
  • RQ2事前学習済みNeRFに依存せずに、スパarselyビューのマルチシーンデータから直接、綺麗で一般化可能な3次元事前分布を拡散モデルが学習できるか、その程度はいかほどか?
  • RQ3学習済み拡散事前分布は、テスト時に任意の数の入力ビューから高品質な3次元再構成を実現するためにどの程度有効か?
  • RQ4NeRFと拡散部のエンドツーエンド共同最適化は、スパarselyビューデータにおいて、分離された2段階学習よりも優れた性能を発揮するか?
  • RQ5拡散モデルの潜在空間が、3次元シーン間の滑らかで意味のある補間を可能にし、良好に構造化され一般化可能な事前分布であることを示唆するか?

主な発見

  • SSDNeRFは、SRN Carsデータセットの3視点サブセットにおいて、Fréchet Inception Distance (FID) 19.04 ±1.10 および Kernel Inception Distance (KID) 8.28 ±0.60 を達成し、優れた非条件的3次元生成品質を示した。
  • 単一ビュー再構成において、SSDNeRFはLPIPSスコア0.106を達成し、訓練セットを全量使用する大多数の先行手法を上回った。
  • スパarselyから密集への再構成において、SSDNeRFはTV正則化付きのアンビエントトライプレーンNeRFやCodeNeRFを顕著に上回り、特に1~4視点という低視点状態で顕著な優位性を示した。
  • 標準的なオートエンコーダーにTV正則化を適用した手法が同じ条件下で失敗する中、本モデルは3入力ビューからの一貫性があり、アーチファクトのない幾何構造を再構成できた。
  • 訓練中の早期停止により滑らかな潜在事前分布が維持され、生成された3次元シーン間の補間がより一貫性があり、視覚的に妥当な結果となった。
  • ガイドランスフィットネスサンプリングスキームにより、任意の数のビューからの有効な再構成が可能となり、テスト時の学習済み拡散事前分布の柔軟性が実証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。