[论文解读] InFusion: Inpainting 3D Gaussians via Learning Depth Completion from Diffusion Prior
InFusion 提出了一种新颖的三维高斯修复方法,利用基于扩散先验的深度补全模型,生成高保真、逼真的三维场景修复结果。通过使用图像条件化的深度修复来初始化三维高斯点,该方法相比以往方法实现了约20倍的推理速度提升,并在视觉质量上表现更优,从而实现了高效且交互式的三维场景编辑,支持用户自定义纹理或插入物体。
3D Gaussians have recently emerged as an efficient representation for novel view synthesis. This work studies its editability with a particular focus on the inpainting task, which aims to supplement an incomplete set of 3D Gaussians with additional points for visually harmonious rendering. Compared to 2D inpainting, the crux of inpainting 3D Gaussians is to figure out the rendering-relevant properties of the introduced points, whose optimization largely benefits from their initial 3D positions. To this end, we propose to guide the point initialization with an image-conditioned depth completion model, which learns to directly restore the depth map based on the observed image. Such a design allows our model to fill in depth values at an aligned scale with the original depth, and also to harness strong generalizability from largescale diffusion prior. Thanks to the more accurate depth completion, our approach, dubbed InFusion, surpasses existing alternatives with sufficiently better fidelity and efficiency under various complex scenarios. We further demonstrate the effectiveness of InFusion with several practical applications, such as inpainting with user-specific texture or with novel object insertion.
研究动机与目标
- 为解决在缺失几何结构与纹理的复杂场景中实现高保真三维高斯修复的挑战。
- 通过利用预训练扩散模型的深度补全,提升三维点初始化的准确性和效率。
- 实现在三维高斯场景中对用户自定义纹理修复和新物体插入等交互式三维编辑功能。
- 克服以往方法因初始三维点放置不佳而导致纹理模糊和收敛缓慢的局限性。
提出的方法
- 该方法首先使用预训练的潜在扩散模型(LDM)进行图像条件化的深度修复,生成与原始场景几何结构对齐的高质量深度图。
- 随后将修复后的深度图反投影至三维空间,生成初始的三维高斯点,确保与场景的几何一致性。
- 针对复杂遮挡,采用渐进式的多视角优化策略,通过多视角信息提升深度补全与点初始化的准确性。
- 通过允许用户修改参考图像,框架支持交互式编辑,直接影响修复区域的纹理与外观。
- 该方法整合了扩散模型的强大生成先验,以增强深度补全效果,尤其在物体边界和复杂结构区域表现更优。
- 该方法端到端进行训练,以同时优化深度补全与后续三维高斯渲染质量,最大限度减少伪影与错位。
实验结果
研究问题
- RQ1基于扩散的深度补全模型是否能显著提升三维高斯修复在保真度与效率方面相较于传统方法的表现?
- RQ2利用预训练扩散模型进行深度补全,如何影响生成的三维高斯点的几何一致性与视觉质量?
- RQ3所提方法在多大程度上可支持交互式三维编辑任务,如用户自定义纹理修复与物体插入?
- RQ4渐进式的多视角优化在存在大范围遮挡或复杂几何结构的场景中,如何提升性能?
- RQ5扩散先验的整合是否能实现对正向视角与360度场景中结构化物体与背景的鲁棒补全?
主要发现
- InFusion 相较于基线方法,将优化时间缩短了20倍,在 SPIn-NeRF 数据集上将推理时间从5小时降低至40秒。
- 该方法在所有对比方法中取得了最低的 LPIPS 分数(0.421)与 FID 分数(92.62),表明其在感知与统计上与真实值的相似度更高。
- 视觉对比显示,InFusion 在多物体遮挡场景中生成的纹理更清晰、几何对齐更优,优于基线方法。
- 在深度补全中引入扩散先验显著减少了深度不连续与错位现象,使三维场景扩展更加连贯。
- 该方法支持交互式纹理编辑与物体插入,而以往方法由于依赖固定或粗糙的初始化,无法实现此类功能。
- 消融实验表明,基于扩散的深度修复优于基于图像的修复与深度对齐技术,尤其在保持物体结构与深度连续性方面表现更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。