Skip to main content
QUICK REVIEW

[論文レビュー] Pix2NeRF: Unsupervised Conditional $π$-GAN for Single Image to Neural Radiance Fields Translation

Shengqu Cai, Anton Obukhov|arXiv (Cornell University)|Feb 26, 2022
Advanced Vision and Imaging被引用数 8
ひとこと要約

Pix2NeRF は、3D やマルチビュー、ポーズの監視なしに高精細な新規ビューを生成する、非教師あり単一画像からNeRFへの変換フレームワークを提案する。再構成と adversarial 目的を用いて学習されたエンコーダーと π-GAN 生成器を同時に最適化することで、1ショット設定において最先端の3D一貫性とビュー合成品質を達成する。

ABSTRACT

We propose a pipeline to generate Neural Radiance Fields~(NeRF) of an object or a scene of a specific class, conditioned on a single input image. This is a challenging task, as training NeRF requires multiple views of the same scene, coupled with corresponding poses, which are hard to obtain. Our method is based on $π$-GAN, a generative model for unconditional 3D-aware image synthesis, which maps random latent codes to radiance fields of a class of objects. We jointly optimize (1) the $π$-GAN objective to utilize its high-fidelity 3D-aware generation and (2) a carefully designed reconstruction objective. The latter includes an encoder coupled with $π$-GAN generator to form an auto-encoder. Unlike previous few-shot NeRF approaches, our pipeline is unsupervised, capable of being trained with independent images without 3D, multi-view, or pose supervision. Applications of our pipeline include 3d avatar generation, object-centric novel view synthesis with a single input image, and 3d-aware super-resolution, to name a few.

研究の動機と目的

  • 限られた幾何的情報の下で新規ビュー合成が困難である単一画像 3D 再構築の課題に対処すること。
  • マルチビュー入力や明示的な 3D 監視を必要とする従来の少しだけのショット NeRF メソッドの限界を克服すること。
  • 生成モデルからの暗黙の 3D 先行情報を活用して、単一画像からの欠落した幾何構造を推定すること。
  • コンテンツとポーズを分離するエンドツーエンドの非教師ありフレームワークを構築し、制御可能な NeRF 生成を実現すること。
  • 再構成と adversarial 目的の共同最適化が、単純な GAN 逆問題解決に比べて 3D 一貫性とビュー忠実度を顕著に向上させることを示すこと。

提案手法

  • π-GAN をバックボーン生成器として用い、潜在変数をカテゴリ固有のニューラルレンダリング場にマッピングし、組み込みの 3D 一貫性を備える。
  • 入力画像を共有潜在空間にマッピングするエンコーダー・ネットワークを導入し、コンテンツとポーズの因子を分離する。
  • エンコーダーと π-GAN 生成器を adversarial および再構成損失の両方を用いて共同で学習する条件付き GAN の設定を実装する。
  • 最適化の安定化のため、訓練の初期段階で再構成を優先し、その後に完全な adversarial 訓練を開始するウォームアップ戦略を適用する。
  • 二重目的最適化を採用する:(1) π-GAN の非条件付き生成目的と (2) エンコーダー・ジェネレータのフィードバックによる自己符号化再構成。
  • コンテンツとポーズのランダムな潜在変数をサンプリングし、生成器を介してレンダリングすることで、ゼロショット NeRF 生成を可能にする。

実験結果

リサーチクエスチョン

  • RQ13D やマルチビューの監視なしに、条件付き GAN ベースのフレームワークが単一画像から高精細で 3D 一貫性のある NeRF を生成できるか?
  • RQ2再構成と adversarial 目的の共同最適化は、単純な GAN 逆問題解決に比べて 3D 一貫性をどのように向上させるか?
  • RQ3ウォームアップ戦略は、単一画像 NeRF 生成における最適化の安定化とモード崩壊の防止にどのような役割を果たすか?
  • RQ4エンコーダーのコンテンツとポーズの分離能力が、新規ビュー合成の品質に及ぼす影響はどの程度か?
  • RQ5このフレームワークはトレーニングカテゴリを越えて一般化可能であり、潜在空間のサンプリングによって多様な 3D 再構築を可能にするか?

主な発見

  • Pix2NeRF は、再構成が悪く幾何的アーティファクトを含む単純な GAN 逆問題解決に比べ、優れた 3D 一貫性とビュー合成品質を達成する。
  • アブレーションスタディの結果、条件付き adversarial 損失を削除すると、3D 一貫性が著しく低下し、視覚的アーティファクトが増加することが判明した。
  • ウォームアップ戦略は極めて重要である:これがないと、モデルは入力ビューに過剰適合し、妥当な新規ビューを生成できなくなる。
  • GAN 逆問題や自己符号化目的を削除すると、ぼやけた不気味なレンダリングが生じるため、両方のコンponents が性能向上に不可欠であることが示された。
  • エンコーダーと π-GAN の再構成と adversarial 損失による共同訓練は、単独の自己符号化に比べ、より良い分離とより現実的な新規ビュー合成を可能にする。
  • ランダムなコンテンツとポーズの潜在変数をサンプリングすることで、多様な NeRF の生成に成功し、ゼロショット 3D 再構築の能力を実証した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。