[論文レビュー] InFusion: Inpainting 3D Gaussians via Learning Depth Completion from Diffusion Prior
InFusionは、拡散事前分布に基づく深度補完モデルを活用して、高精細で写真撮影に類似した3Dシーン補完を実現する、革新的な3Dガウス補完手法を提案する。画像条件付き深度補完を用いて3Dガウスを初期化することで、従来手法と比較して約20倍高速な推論が達成され、視覚的品質も優れている。これにより、ユーザー定義のテクスチャや挿入されたオブジェクトを用いた効率的でインタラクティブな3Dシーン編集が可能になる。
3D Gaussians have recently emerged as an efficient representation for novel view synthesis. This work studies its editability with a particular focus on the inpainting task, which aims to supplement an incomplete set of 3D Gaussians with additional points for visually harmonious rendering. Compared to 2D inpainting, the crux of inpainting 3D Gaussians is to figure out the rendering-relevant properties of the introduced points, whose optimization largely benefits from their initial 3D positions. To this end, we propose to guide the point initialization with an image-conditioned depth completion model, which learns to directly restore the depth map based on the observed image. Such a design allows our model to fill in depth values at an aligned scale with the original depth, and also to harness strong generalizability from largescale diffusion prior. Thanks to the more accurate depth completion, our approach, dubbed InFusion, surpasses existing alternatives with sufficiently better fidelity and efficiency under various complex scenarios. We further demonstrate the effectiveness of InFusion with several practical applications, such as inpainting with user-specific texture or with novel object insertion.
研究の動機と目的
- 複雑なシーンにおける欠落した幾何構造とテクスチャを補完する高忠実度な3Dガウス補完の課題に対処すること。
- 事前学習済みの拡散モデルからの深度補完を活用して、3Dポイント初期化の精度と効率を向上させること。
- ユーザー定義のテクスチャ補完や新規オブジェクト挿入を含む、3Dガウスシーン内でのインタラクティブ3D編集を可能にすること。
- 不良な3Dポイント初期化に起因するぼやけたテクスチャや収束が遅いという従来手法の限界を克服すること。
提案手法
- 本手法は、事前学習済みの潜在拡散モデル(LDM)を用いて、元のシーン幾何構造と整合性を持つ高品質な深度マップを生成する画像条件付き深度補完を最初に実行する。
- 補完された深度マップは、3次元空間にアンプロジェクションされ、シーンと幾何的に整合性を持つ初期3Dガウスポイントを生成する。
- 複雑な隠蔽状態に対処するため、複数のビューを用いて深度補完とポイント初期化の精度を向上させる段階的改善戦略が採用される。
- ユーザーが参照画像を変更できるようにすることで、フレームワークはインタラクティブ編集をサポートし、補完された3D領域のテクスチャと外観に直接影響を与える。
- 拡散モデルからの強力な生成的事前分布を統合することで、特にオブジェクトの境界や複雑な構造において深度補完の品質が向上する。
- 深度補完とその後の3Dガウスレンダリング品質を同時に最適化するエンドツーエンドの学習により、アーチファクトやずれを最小限に抑える。
実験結果
リサーチクエスチョン
- RQ1拡散ベースの深度補完モデルは、従来手法と比較して、3Dガウス補完の忠実度と効率を顕著に向上させることができるか?
- RQ2事前学習済みの拡散モデルからの深度補完を用いることで、生成された3Dガウスの幾何的整合性と視覚的品質はどのように変化するか?
- RQ3提案手法は、ユーザー定義のテクスチャ補完やオブジェクト挿入といったインタラクティブ3D編集タスクをどの程度サポートできるか?
- RQ4段階的でマルチビューの改善により、大規模な隠蔽や複雑な幾何構造を有するシーンでの性能はどのように向上するか?
- RQ5拡散事前分布の統合により、フォワードフォースティングおよび360度のシーンにおいて、構造的オブジェクトと背景のロバストな補完が可能になるか?
主な発見
- InFusionは、ベースライン手法と比較して最適化時間で20倍の高速化を達成し、SPIn-NeRFデータセット上では推論時間を5時間から40秒に短縮した。
- すべての比較手法の中で、LPIPSスコア(0.421)とFIDスコア(92.62)が最低であり、真値との間で優れた知覚的および統計的類似性を示している。
- 視覚的比較では、特に複数のオブジェクトが重なって隠蔽されている状況において、InFusionがよりシャープなテクスチャと良好な幾何的整合性を生成していることが示された。
- 深度補完における拡散事前分布の使用により、深度の不連続性やずれが顕著に減少し、より一貫性のある3次元シーンの拡張が可能になった。
- 本手法は、従来手法が固定または粗い初期化に依存していたため対応できなかった、インタラクティブなテクスチャ編集とオブジェクト挿入を可能にした。
- アブレーションスタディの結果、画像ベースの補完や深度アライメント技術と比較して、拡散ベースの深度補完が、オブジェクト構造と深度の連続性をより良く保持する点で優れていることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。