[论文解读] DITTO-NeRF: Diffusion-based Iterative Text To Omni-directional 3D Model
DITTO-NeRF 提出了一种基于扩散的迭代方法,通过逐步从内边界(IB)到外边界(OB)视图进行图像修复潜在扩散和渐进式优化,实现从文本提示或单张图像生成高保真、全向的3D NeRF模型。该方法在3D生成质量、多样性及训练速度方面达到最先进水平,优于先前的 DreamFusion 和 NeuralLift-360 等方法。
The increasing demand for high-quality 3D content creation has motivated the development of automated methods for creating 3D object models from a single image and/or from a text prompt. However, the reconstructed 3D objects using state-of-the-art image-to-3D methods still exhibit low correspondence to the given image and low multi-view consistency. Recent state-of-the-art text-to-3D methods are also limited, yielding 3D samples with low diversity per prompt with long synthesis time. To address these challenges, we propose DITTO-NeRF, a novel pipeline to generate a high-quality 3D NeRF model from a text prompt or a single image. Our DITTO-NeRF consists of constructing high-quality partial 3D object for limited in-boundary (IB) angles using the given or text-generated 2D image from the frontal view and then iteratively reconstructing the remaining 3D NeRF using inpainting latent diffusion model. We propose progressive 3D object reconstruction schemes in terms of scales (low to high resolution), angles (IB angles initially to outer-boundary (OB) later), and masks (object to background boundary) in our DITTO-NeRF so that high-quality information on IB can be propagated into OB. Our DITTO-NeRF outperforms state-of-the-art methods in terms of fidelity and diversity qualitatively and quantitatively with much faster training times than prior arts on image/text-to-3D such as DreamFusion, and NeuralLift-360.
研究动机与目标
- 解决现有图像到3D方法中多视角一致性差及与输入图像对应关系弱的问题。
- 克服当前文本到3D生成方法中多样性有限且计算成本高的问题。
- 实现在单张图像或文本提示下高效训练的高质量、全向3D NeRF生成。
- 通过从内边界到外边界视图逐步传播高质量信息,提升3D重建的保真度。
- 开发一种可扩展的渐进式重建流程,同时提升视觉质量和结构一致性。
提出的方法
- 该方法利用单目深度估计和前向视图的2D图像,构建内边界(IB)视角的高质量部分3D NeRF模型。
- 采用带有得分蒸馏采样(SDS)的图像修复潜在扩散模型(LDM),迭代重建外边界(OB)视角中缺失的3D区域。
- 提出渐进式全局视图采样(PGVS),在训练初期优先处理IB视角,并逐步扩展至OB视角,从而提升重建稳定性。
- 应用基于可靠性的掩码策略,保留高置信度IB区域,同时逐步优化整个3D体素。
- 在所有IB和OB区域之间实施多尺度一致性优化,以最小化差异并增强几何保真度。
- 当仅提供文本提示时,框架整合文本到图像的扩散模型,以生成多样化的2D图像先验。
实验结果
研究问题
- RQ1基于扩散的迭代3D生成能否提升图像到3D合成中的多视角一致性和与输入图像的对应关系?
- RQ2渐进式、视图感知的采样策略能否提升3D重建质量和训练效率?
- RQ3将潜在扩散与NeRF结合,能否实现从文本或单张图像生成高保真、多样化的3D结果?
- RQ4基于可靠性的掩码策略和多尺度优化如何影响3D对象的一致性与伪影减少?
- RQ5与现有基于扩散和NeRF的方法相比,所提方法能否在3D生成质量和训练速度方面均达到最先进水平?
主要发现
- 在图像到3D生成任务中,DITTO-NeRF 的表现优于最先进方法,在用户研究中实现了更优的多视角一致性和与源图像的对应关系。
- 在文本到3D生成中,DITTO-NeRF 的输出多样性与保真度显著优于先前方法(如 Stable-DreamFusion 和 Latent-NeRF),平均意见评分显示显著提升。
- 与 NeuralLift-360 和 DreamFusion 相比,该方法显著缩短了训练时间,在计算效率更高的前提下实现了高质量结果。
- 消融实验证实,维度细化能有效消除由NeRF渲染中低维潜在投影导致的锯齿伪影。
- 渐进式全局视图采样(PGVS)优于其他采样分布策略(如移动贝塔分布和离散累积),在前向和后向视图重建中表现更优。
- 基于可靠性的掩码策略增强了对高置信度IB区域的保留,从而在所有视图中实现更一致、更稳定的3D重建。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。