[论文解读] Uncertainty-Driven Active Vision for Implicit Scene Reconstruction
本文提出了一种基于不确定性的主动视觉框架,用于隐式场景重建,通过体积渲染估计占据不确定性来选择最优视角,显著提升了在极少视角下的重建质量。该方法仅使用2D监督,在ABC和CO3D数据集上实现了最先进性能,并在视角选择与形状理解方面优于强基线模型。
Multi-view implicit scene reconstruction methods have become increasingly popular due to their ability to represent complex scene details. Recent efforts have been devoted to improving the representation of input information and to reducing the number of views required to obtain high quality reconstructions. Yet, perhaps surprisingly, the study of which views to select to maximally improve scene understanding remains largely unexplored. We propose an uncertainty-driven active vision approach for implicit scene reconstruction, which leverages occupancy uncertainty accumulated across the scene using volume rendering to select the next view to acquire. To this end, we develop an occupancy-based reconstruction method which accurately represents scenes using either 2D or 3D supervision. We evaluate our proposed approach on the ABC dataset and the in the wild CO3D dataset, and show that: (1) we are able to obtain high quality state-of-the-art occupancy reconstructions; (2) our perspective conditioned uncertainty definition is effective to drive improvements in next best view selection and outperforms strong baseline approaches; and (3) we can further improve shape understanding by performing a gradient-based search on the view selection candidates. Overall, our results highlight the importance of view selection for implicit scene reconstruction, making it a promising avenue to explore further.
研究动机与目标
- 为解决在小视角预算下隐式场景重建中主动视角选择研究的不足。
- 开发一种方法,通过最大化减少重建不确定性来选择视角,而非依赖启发式覆盖或信息增益。
- 构建一种基于占据的重建模型,可使用2D或3D监督进行训练。
- 通过基于射线的体积渲染估计可观测不确定性,实现对视角空间的高效探索。
- 证明在视角候选集上进行基于梯度的搜索可进一步提升形状理解能力。
提出的方法
- 该方法使用神经隐式模型从多视角图像中预测3D占据概率,训练时采用从渲染图像中获得的2D监督或来自真实占据的3D监督。
- 将体积渲染扩展至沿射线累积预测占据概率,从而实现对场景未观测区域的不确定性估计。
- 视角选择由一种视角条件化的不确定性度量驱动,用于识别最可能降低模型不确定性的视角。
- 在射线上计算不确定性估计,并将其作为评分用于对候选视角进行排序,优先选择能揭示高不确定性区域的视角。
- 对候选视角位置应用基于梯度的搜索以优化选择,从而提升形状重建质量。
- 该框架在合成数据集(ABC)和真实场景数据集(CO3D)上进行评估,展示了在多样化场景类型下的鲁棒性。
实验结果
研究问题
- RQ1在隐式场景重建中,基于不确定性的视角选择是否能优于基于最大覆盖或信息增益的启发式方法?
- RQ2当与基于不确定性的主动视角选择结合时,2D监督在实现高质量占据重建方面的有效性如何?
- RQ3在低视角设置下,对候选视角进行基于梯度的优化是否能进一步提升形状理解?
- RQ4视角条件化的不确定性估计是否能带来比标准不确定性度量更富信息量的视角获取?
- RQ5所提方法在包括真实场景数据在内的多样化场景类型中是否具有良好的泛化能力?
主要发现
- 所提出的重建模型在ABC数据集上实现了最先进性能,即使仅使用2D监督和最多100张输入图像训练亦然。
- 在ABC和CO3D数据集上,基于不确定性的视角选择策略在体素和投影指标上均显著优于强基线模型。
- 在CO3D数据集上,即使缺乏3D监督,该方法仍保持优异性能,凸显其对真实世界数据的鲁棒性。
- 对候选视角应用基于梯度的搜索可带来可测量的形状理解提升,尤其在复杂或遮挡区域表现更优。
- 校准曲线显示不确定性估计具有良好校准性,验证集上的校准误差为0.031,测试集上的校准误差为0.052,表明不确定性量化可靠。
- 该方法能有效降低重建不确定性,通过体积渲染估计的可观测不确定性与实际场景几何改善之间表现出强相关性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。