[论文解读] Improved Direct Voxel Grid Optimization for Radiance Fields Reconstruction
本论文提出 DVGOv2,即直接体素网格优化框架的改进版本,通过自定义 CUDA 内核将训练速度提升 2–3 倍,并支持前向视角与无界向内视角场景的捕捉。它引入了一种高效的 O(N) 畸变损失实现方式,提升了渲染质量与训练速度,同时在 PyTorch 中采用简单的密集网格结构,保持了高保真结果。
In this technical report, we improve the DVGO framework (called DVGOv2), which is based on Pytorch and uses the simplest dense grid representation. First, we re-implement part of the Pytorch operations with cuda, achieving 2-3x speedup. The cuda extension is automatically compiled just in time. Second, we extend DVGO to support Forward-facing and Unbounded Inward-facing capturing. Third, we improve the space time complexity of the distortion loss proposed by mip-NeRF 360 from O(N^2) to O(N). The distortion loss improves our quality and training speed. Our efficient implementation could allow more future works to benefit from the loss.
研究动机与目标
- 通过显式体素网格表示,在不牺牲重建质量的前提下显著加速辐射场的训练。
- 将原始 DVGO 框架扩展至支持前向视角与无界向内视角场景的重建。
- 将畸变损失计算从 O(N²) 复杂度优化至 O(N) 复杂度,以提升训练效率与渲染质量。
- 通过基于 PyTorch 的实现保持方法的简洁性与易用性,同时通过针对性的 CUDA 加速实现高性能。
- 通过提供高效、可重用的实现,推动畸变损失的广泛应用。
提出的方法
- 通过 CUDA 重新实现关键 PyTorch 操作,实现 2–3 倍速度提升,并采用即时编译技术实现无缝集成。
- 通过受 mip-NeRF 360 启发的压缩空间参数化方法,将 DVGO 框架扩展至支持前向视角与无界向内视角场景。
- 通过将公式 (1) 中的双重求和重新组织为对采样点的线性遍历,提出一种新颖的 O(N) 畸变损失计算方案。
- 采用混合方法:显式密度与特征网格结合浅层 MLP 实现视角相关颜色,实现快速推理与训练。
- 应用两阶段 TV 损失策略:前 10,000 次迭代采用密集计算,之后仅对活跃网格点进行稀疏计算,以减少开销。
- 采用长方体体素网格并结合压缩空间变换(p=2 或 p=∞),以更优地将网格点分配给无界场景中的背景。
实验结果
研究问题
- RQ1显式辐射场方法的训练速度是否可在不改变底层数据结构的前提下实现显著提升?
- RQ2对于基于点采样的方法,畸变损失是否可实现 O(N) 时间复杂度的高效计算,从而使其适用于高分辨率、密集网格方法?
- RQ3DVGO 框架是否可扩展至支持前向视角与无界向内视角场景,同时保持高重建质量?
- RQ4O(N) 畸变损失是否能同时提升密集网格辐射场的训练速度与渲染质量?
- RQ5基于完全 PyTorch 的简单框架,结合选择性 CUDA 加速,是否可实现与最先进方法相当的性能?
主要发现
- 通过 CUDA 优化操作与即时编译,DVGOv2 相较原始 DVGO 实现了 2–3 倍的速度提升。
- O(N) 畸变损失实现将计算复杂度从 O(N²) 降低至 O(N),显著提升了训练效率与渲染质量。
- 在 LLFF 数据集上,DVGOv2 实现 PSNR 26.34、SSIM 0.838 与 LPIPS 0.197,优于未使用畸变损失的基线 DVGO。
- 在 mip-NeRF 360 数据集上,DVGOv2 使用 p=∞ 压缩空间实现 PSNR 25.42 与 SSIM 0.695,接近 NeRF++ 性能,且训练时间显著缩短。
- 在 mip-NeRF 360 数据集上,使用长方体压缩空间(p=∞)可提升结果,而 p=2 在 Tanks&Temples 上表现更优,表明对数据集特定的光照不一致性具有敏感性。
- 在单个 320³ 网格下,LLFF 数据集训练时间缩短至 10.9 分钟,mip-NeRF 360 数据集为 14.0 分钟,尽管分辨率有限,仍展现出高效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。