Skip to main content
QUICK REVIEW

[論文レビュー] DiffRF: Rendering-Guided 3D Radiance Field Diffusion

Norman Müller, Yawar Siddiqui|arXiv (Cornell University)|Dec 2, 2022
Computer Graphics and Visualization Techniques被引用数 6
ひとこと要約

DiffRFは、3次元レンダリング損失によってガイドされるボクセルグリッド上の3次元ノイズ除去U-Netを用いて、マルチビュー一貫性のある事前分布を学習することで、直接的な3次元ラディアンスフィールド合成のための最初の拡散モデルを導入した。この手法は、タスク固有の微調整なしに高精度で視点一貫性のある3次元生成およびマスキング済み補完を可能にし、FID(15.95 vs. 16.54)およびMMD(4.42 vs. 5.62)においてGANを上回る性能を発揮した。

ABSTRACT

We introduce DiffRF, a novel approach for 3D radiance field synthesis based on denoising diffusion probabilistic models. While existing diffusion-based methods operate on images, latent codes, or point cloud data, we are the first to directly generate volumetric radiance fields. To this end, we propose a 3D denoising model which directly operates on an explicit voxel grid representation. However, as radiance fields generated from a set of posed images can be ambiguous and contain artifacts, obtaining ground truth radiance field samples is non-trivial. We address this challenge by pairing the denoising formulation with a rendering loss, enabling our model to learn a deviated prior that favours good image quality instead of trying to replicate fitting errors like floating artifacts. In contrast to 2D-diffusion models, our model learns multi-view consistent priors, enabling free-view synthesis and accurate shape generation. Compared to 3D GANs, our diffusion-based approach naturally enables conditional generation such as masked completion or single-view 3D synthesis at inference time.

研究の動機と目的

  • 姿勢付き2次元画像から直接3次元ラディアンスフィールドを合成する生成モデルを開発し、高精度な3次元アセット作成を実現すること。
  • 曖昧でアーティファクトを伴うラディアンスフィールドの教師信号の課題に対処するため、レンダリングにガイドされたノイズ除去損失を導入すること。
  • タスク固有の微調整なしに、マスキング補完や単一視点3次元合成などの条件付き3次元生成タスクを可能にすること。
  • 自由視点合成と正確な幾何的再構築を可能にするマルチビュー一貫性のある事前分布を学習すること。
  • ベンチマークデータセットにおいて、既存のGANベースの手法よりも画像品質および幾何的忠実度の両面で優れた性能を発揮すること。

提案手法

  • ラディアンスフィールドの明示的ボクセルグリッド表現上で直接作用する3次元ノイズ除去拡散モデルを提案する。
  • ノイズ除去プロセスを高品質な画像合成に向かわせるようにバイアスをかけるレンダリングにガイドされた損失を導入する。これにより、アーティファクトへのフィッティングを低減する。
  • ボクセルグリッド内のノイズを予測するためのノイズ除去U-Netアーキテクチャを用い、ノイズスケジュールおよび逆方向の拡散サンプリングを実装する。
  • 訓練中に複数の視点からのレンダリングされた2次元画像と一致するように予測されたラディアンスフィールドを整えるためにボリュメトリックレンダリング損失を適用する。
  • 分類器ガイドランスを用いて条件付き生成を実現し、入力画像とのレンダリング誤差を最小化する方向にノイズ除去プロセスを誘導する。
  • マスキングされた拡散プロセスを用いて、既知の領域とノイズ除去推定値を繰り返し融合することで、マスキングされたラディアンスフィールドの補完を実現する:$ f_{0}^{t-1} = \sqrt{\bar{\alpha}_{t}}(m \odot \tilde{f}^{t}_{0} + (1-m) \odot f^{in}) $、ここで$ m $はバイナリマスクである。
Figure 2 : For a time step $t$ uniformly sampled from ${1,...,T}$ , we first diffuse an initial radiance field $f_{0}$ according to a fixed noising schedule. The resulting $f_{t}$ is passed through a time-conditioned 3D-UNet, giving an estimate of the applied noise $\epsilon$ . We guide the model by
Figure 2 : For a time step $t$ uniformly sampled from ${1,...,T}$ , we first diffuse an initial radiance field $f_{0}$ according to a fixed noising schedule. The resulting $f_{t}$ is passed through a time-conditioned 3D-UNet, giving an estimate of the applied noise $\epsilon$ . We guide the model by

実験結果

リサーチクエスチョン

  • RQ1中間表現を経由せずに、姿勢付き2次元画像から直接3次元ラディアンスフィールドを生成する拡散モデルを効果的に訓練できるか?
  • RQ2レンダリングにガイドされた損失は、ノイズやアーティファクトへのフィッティングを低減させることで、生成されたラディアンスフィールドの品質をどのように向上させるか?
  • RQ3拡散ベースの3次元生成は、自由視点合成と正確な幾何的再構築を可能にするマルチビュー一貫性のある事前分布を学習できるか?
  • RQ4タスク固有の微調整なしに、マスキングされたラディアンスフィールド補完のような新しい条件付きタスクに拡散フレームワークを適応できるか?
  • RQ5拡散ベースの3次元ラディアンスフィールドモデルは、最先端のGANベースの手法と比較して、画像品質および幾何的正確性の両面で優れた性能を示すか?

主な発見

  • DiffRFは、PhotoShape Chairsデータセットで15.95のFréchet Inception Distance(FID)を達成し、GANベースのEG3Dベースライン(16.54)を上回った。
  • モデルは、EG3Dの5.62から4.42にMulti-scale Structural Similarity(MMD)スコアを低減させ、幾何的忠実度の向上を示した。
  • マスキング補完において、DiffRFはEG3Dよりもより多様で調和の取れた補完を生成し、元のマスキングされていない領域をより良く保持した。
  • 定量的評価では、同じマスキングレベルにおいて、DiffRFはEG3Dよりもマスキングされていない領域で高いフォトメトリック精度(mPSNR)を維持した。
  • 分類器ガイドランスを用いて姿勢付き画像と前景マスクを入力として、単一視点3次元合成を実現した。
  • DiffRFは、レンダリングの監視により真のデータが不足する状況を克服し、3次元ラディアンスフィールド上で直接拡散モデルを訓練する可能性を示した。
Figure 3 : Qualitative comparison between $\pi$ -GAN [ 7 ] , EG3D [ 8 ] , and our method on PhotoShape Chairs [ 46 ] . Our approach leads to diverse, geometrically accurate models that allow for high-quality renderings.
Figure 3 : Qualitative comparison between $\pi$ -GAN [ 7 ] , EG3D [ 8 ] , and our method on PhotoShape Chairs [ 46 ] . Our approach leads to diverse, geometrically accurate models that allow for high-quality renderings.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。