[論文レビュー] Deceptive-NeRF/3DGS: Diffusion-Generated Pseudo-Observations for High-Quality Sparse-View Reconstruction
Deceptive-NeRFは、粗いNeRFレンダリングを条件として画像生成モデルを用いて写真のようにリアルな疑似観測を生成することで、少数の入力ビューからのNeRF再構築のための新規フレームワークを提案する。HypersimおよびLLFFデータセットにおける5ビューおよび10ビューの設定を含む複数のベンチマークで、PSNR、SSIM、LPIPSの各指標において、既存手法を上回る最先端の性能を達成している。
Novel view synthesis via Neural Radiance Fields (NeRFs) or 3D Gaussian Splatting (3DGS) typically necessitates dense observations with hundreds of input images to circumvent artifacts. We introduce Deceptive-NeRF/3DGS to enhance sparse-view reconstruction with only a limited set of input images, by leveraging a diffusion model pre-trained from multiview datasets. Different from using diffusion priors to regularize representation optimization, our method directly uses diffusion-generated images to train NeRF/3DGS as if they were real input views. Specifically, we propose a deceptive diffusion model turning noisy images rendered from few-view reconstructions into high-quality photorealistic pseudo-observations. To resolve consistency among pseudo-observations and real input views, we develop an uncertainty measure to guide the diffusion model's generation. Our system progressively incorporates diffusion-generated pseudo-observations into the training image sets, ultimately densifying the sparse input observations by 5 to 10 times. Extensive experiments across diverse and challenging datasets validate that our approach outperforms existing state-of-the-art methods and is capable of synthesizing novel views with super-resolution in the few-view setting.
研究の動機と目的
- 実際のユーザーが撮影したデータで一般的な極めてスパースな入力ビューにおけるNeRF再構築品質の悪さという課題に対処すること。
- 数百枚のビューを必要とする通常のNeRFの限界を克服し、スパースな監視のもとでも機能するようにすること。
- 事前学習済み2D拡散モデルを正則化子としてではなく、意味的に一貫性があり、写真のようにリアルな疑似観測を生成する生成器として活用し、学習データを拡張すること。
- 逐次的に新しい疑似観測を生成してNeRFを段階的に精錬するプログレッシブトレーニング戦略を導入することで、再構築の忠実度と一般化性能を向上させること。
- 疑似観測生成中にマルチビューの一貫性とシーンの意味的整合性を維持し、アーチファクトや幻覚を回避すること。
提案手法
- まず、スパースな入力画像とそのカメラポーズから粗いNeRFを学習し、初期の新規ビューのレンダリングと深度マップを生成する。
- 新規の不正な拡散モデルを用いて、粗いNeRFのレンダリングを条件として、高精細な疑似観測を生成する。このモデルはRGBと深度の両方を入力として使用する。
- 不正な拡散モデルは、粗いNeRFの出力と整合性を保ちつつ、人間の知覚に近いリアルさを持つ画像を生成するように学習される。
- プログレッシブトレーニング戦略を適用する:各反復で、現在のNeRFがレンダリングを生成し、それらを用いて次の反復用のNeRFの学習に使用する新しい疑似観測を生成する。
- 最終的なNeRFの学習を、実際の入力画像と生成された疑似観測の両方で行い、マルチビューの監視によってビュー間の一貫性を強制する。
- 画像キャプションとテキストインバージョンを用いたテキスト条件付けを統合し、疑似観測におけるスタイルとコンテンツの整合性を向上させる。
実験結果
リサーチクエスチョン
- RQ1拡散モデルを正則化子としてではなく、データ生成器として再利用することで、スパースな監視のもとでのNeRF再構築を改善できるか?
- RQ2粗いNeRFレンダリングを条件として、拡散モデルがシーンの意味的整合性とマルチビューの一貫性を保った疑似観測をどれほど効果的に生成できるか?
- RQ3逐次的に新しい疑似観測を生成してNeRFを段階的に精錬するプログレッシブトレーニング戦略は、1段階の生成と比較して再構築品質を向上させるか?
- RQ4深度条件付けとマルチモodalなテキスト条件付け(画像キャプション+テキストインバージョン)は、生成された疑似観測のリアリズムと一貫性を向上させる上でどの程度寄与しているか?
- RQ5本手法は、極めてスパースな入力ビューのもとでの少数ショット新規ビュー合成において、既存の最先端手法をどの程度上回るか?
主な発見
- Deceptive-NeRFは、HypersimおよびLLFFデータセットの全評価指標で最先端の性能を達成しており、20ビュー設定下でPSNRが22.41、SSIMが0.812を記録した。
- 5ビュー設定では、Deceptive-NeRFは最高のPSNRとSSIMを達成し、LPIPSでは唯一の2位にとどまり、優れた知覚的品質を示している。
- アブレーションスタディの結果、プログレッシブトレーニング、深度条件付け、データ拡張、および二重テキスト埋め込み(キャプション+テキストインバージョン)の各要素が最適な性能を発揮するために不可欠であることが確認された。
- 全コンポONENTを備えたモデルはPSNRが22.41を達成しており、プログレッシブトレーニングを除いたバージョン(PSNR 19.90)や深度条件付けを除いたバージョン(PSNR 18.79)を著しく上回っている。
- 定性的な結果では、Deceptive-NeRFは、特に物体レベルのテクスチャや幾何学的形状において、アーチファクトが少なく、よりシャープで詳細な新規ビューを生成している。
- 本手法は、わずか5枚の入力ビューからでも、写真のようにリアルなビューを効果的に合成できており、極めてスパースな入力に対しても高い耐性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。