Skip to main content
QUICK REVIEW

[論文レビュー] DITTO-NeRF: Diffusion-based Iterative Text To Omni-directional 3D Model

Hoigi Seo, Hayeon Kim|arXiv (Cornell University)|Apr 6, 2023
Computer Graphics and Visualization Techniques被引用数 6
ひとこと要約

DITTO-NeRF は、テキストプロンプトまたは単一の画像から高精細で全方向性の 3D NeRF モデルを生成する、拡散ベースの反復的手法を提案する。入境界(IB)から外境界(OB)の視点へと段階的に 3D 物体を再構築する際、インpainting 潜在拡散モデルと段階的精錬を用いる。本手法は、3D 再構築の品質、多様性、学習速度において最先端の性能を達成し、DreamFusion や NeuralLift-360 などの先行手法を上回る。

ABSTRACT

The increasing demand for high-quality 3D content creation has motivated the development of automated methods for creating 3D object models from a single image and/or from a text prompt. However, the reconstructed 3D objects using state-of-the-art image-to-3D methods still exhibit low correspondence to the given image and low multi-view consistency. Recent state-of-the-art text-to-3D methods are also limited, yielding 3D samples with low diversity per prompt with long synthesis time. To address these challenges, we propose DITTO-NeRF, a novel pipeline to generate a high-quality 3D NeRF model from a text prompt or a single image. Our DITTO-NeRF consists of constructing high-quality partial 3D object for limited in-boundary (IB) angles using the given or text-generated 2D image from the frontal view and then iteratively reconstructing the remaining 3D NeRF using inpainting latent diffusion model. We propose progressive 3D object reconstruction schemes in terms of scales (low to high resolution), angles (IB angles initially to outer-boundary (OB) later), and masks (object to background boundary) in our DITTO-NeRF so that high-quality information on IB can be propagated into OB. Our DITTO-NeRF outperforms state-of-the-art methods in terms of fidelity and diversity qualitatively and quantitatively with much faster training times than prior arts on image/text-to-3D such as DreamFusion, and NeuralLift-360.

研究の動機と目的

  • 既存の画像から 3D への変換手法における多視点一貫性の低さと、入力画像との対応の悪さを解決すること。
  • 現在のテキストから 3D への生成手法における多様性の制限と計算コストの高さを克服すること。
  • 単一の画像またはテキストプロンプトから高品質で全方向性の 3D NeRF を効率的な学習で生成できること。
  • 入境界から外境界の視点へと高品質な情報を段階的に伝搬させることで、3D 再構築の忠実度を向上させること。
  • 視覚的品質と構造的一致性を両立するスケーラブルで段階的な再構築パイプラインの開発

提案手法

  • 本手法は、単眼深度推定と前面からの 2D 画像を用いて、入境界(IB)視点の高品質な部分的 3D NeRF モデルを構築する。
  • 外境界(OB)視点における欠落している 3D リジョンを段階的に再構築するために、スコア分散抽出(SDS)を用いたインpainting 潜在拡散モデル(LDM)を採用する。
  • 初期学習段階で IB 視点を優先し、徐々に OB 視点へと拡張する「段階的グローバルビュー採択(PGVS)」を導入し、再構築の安定性を向上させる。
  • 信頼性ガイドドマスキングを適用して、高信頼度の IB リジョンを保持しつつ、3D ボリューム全体を段階的に精錬する。
  • すべての IB および OB リジョンでマルチスケール一貫性精錬を用いて、乖離を最小限に抑え、幾何学的忠実度を向上させる。
  • テキストプロンプトのみが提供された場合には、テキストから画像への拡散モデルを統合して、多様な 2D 画像事前知識を生成する。

実験結果

リサーチクエスチョン

  • RQ1反復的拡散ベースの 3D 生成は、画像から 3D への合成における多視点一貫性と入力画像との対応性を向上させることができるか?
  • RQ2段階的かつビューに配慮した採択戦略は、3D 再構築の品質と学習効率を向上させることができるか?
  • RQ3潜在拡散モデルと NeRF を組み合わせることで、テキストまたは単一画像から高精細で多様な 3D 生成が可能になるか?
  • RQ4信頼性ガイドドマスキングとマルチスケール精錬は、3D 物体の一貫性とアーティファクト低減にどのように影響するか?
  • RQ5提案手法は、既存の拡散ベースおよび NeRF ベースの手法と比較して、3D 生成の品質と学習速度の両面で SOTA の性能を達成できるか?

主な発見

  • ユーザースタディーにおいて、DITTO-NeRF は画像から 3D への生成において最先端の手法を上回り、優れた多視点一貫性と元画像との対応性を達成した。
  • テキストから 3D への生成において、Stable-DreamFusion や Latent-NeRF などの先行研究と比較して、出力の多様性と忠実度が高く、平均評価スコアが顕著に向上した。
  • NeuralLift-360 や DreamFusion と比較して、学習時間を顕著に短縮し、より効率的な計算で高品質な結果を得られた。
  • アブレーションスタディーにより、次元精錬が NeRF 渲染における低次元潜在投影に起因するジグザグアーティファクトを効果的に除去することを確認した。
  • 段階的グローバルビュー採択(PGVS)は、移動ベータや離散的蓄積といった代替の採択分布を上回り、前面および背面視点の再構築が優れていることが示された。
  • 信頼性ガイドドマスキング戦略により、高信頼度の IB リジョンの保持が向上し、全視点における一貫性と安定性の高い 3D 再構築が実現された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。