[论文解读] Deep Surface Normal Estimation with Hierarchical RGB-D Fusion
本文提出了一种具有自适应特征重加权的分层RGB-D融合网络,用于从单张RGB-D图像中准确估计表面法向。通过在多个尺度上融合来自RGB分支和深度分支的特征,同时利用置信度图抑制噪声较大的深度输入,并采用混合多尺度损失函数处理不完美的真实值数据,该方法在保持更清晰细节的同时,提升了对深度退化数据的鲁棒性,实现了最先进性能。
The growing availability of commodity RGB-D cameras has boosted the applications in the field of scene understanding. However, as a fundamental scene understanding task, surface normal estimation from RGB-D data lacks thorough investigation. In this paper, a hierarchical fusion network with adaptive feature re-weighting is proposed for surface normal estimation from a single RGB-D image. Specifically, the features from color image and depth are successively integrated at multiple scales to ensure global surface smoothness while preserving visually salient details. Meanwhile, the depth features are re-weighted with a confidence map estimated from depth before merging into the color branch to avoid artifacts caused by input depth corruption. Additionally, a hybrid multi-scale loss function is designed to learn accurate normal estimation given noisy ground-truth dataset. Extensive experimental results validate the effectiveness of the fusion strategy and the loss design, outperforming state-of-the-art normal estimation schemes.
研究动机与目标
- 为解决在表面法向估计中RGB与深度特征融合策略不足的问题。
- 减少由深度传感器噪声和深度图中缺失像素引起的伪影。
- 在多视角重建生成的真实法向图存在噪声或不完整的情况下,仍能提升法向估计的准确性。
- 设计一种损失函数,在监督不完善的情况下平衡全局平滑性与局部细节保持。
提出的方法
- 分层融合机制在解码器的多个尺度上整合来自RGB和深度分支的特征,以同时保留全局平滑性与局部锐度。
- 从输入深度图中估计置信度图,在特征融合前对深度特征进行重加权,降低边缘和孔洞等低置信度区域的影响。
- 网络采用多分支编码器-解码器架构并结合跳跃连接,以保持空间分辨率和特征保真度。
- 混合多尺度损失在不同分辨率下结合L1与L2损失:在高分辨率下使用L1损失以保留精细细节,在低分辨率下使用L2损失以保证粗粒度准确性。
- 置信度图通过一个轻量级子网络计算,用于评估深度的可靠性,尤其在高不确定性区域。
- 模型在Matterport3D和ScanNet数据集上进行训练,使用多视角重建生成的真实法向作为监督信号,损失函数设计用于缓解重建噪声的影响。
实验结果
研究问题
- RQ1如何在多个尺度上有效融合RGB与深度特征,以提升表面法向估计性能?
- RQ2基于置信度的深度特征重加权能否减少由深度传感器噪声和缺失数据引起的伪影?
- RQ3在使用噪声真实法向图进行训练时,混合多尺度损失函数是否能提升性能?
- RQ4与早期或晚期融合策略相比,分层融合在细节保留与准确性方面表现如何?
主要发现
- 所提出的分层融合结合置信度重加权方法在定性比较中显著优于早期和晚期融合基线方法,尤其在深度孔洞区域表现更优。
- 在Matterport3D数据集上,该方法在30°阈值下的平均误差为13.062°,中值误差为6.090°,优于当前最先进方法。
- 在ScanNet数据集上,该方法在30°阈值下的平均误差为14.590°,中值误差为7.468°,展现出跨数据集的强大泛化能力。
- 消融实验表明,混合损失函数相比单独使用L1或L2损失,能生成更锐利且细节保留更好的结果。
- 置信度图显著提升了深度孔洞附近的性能,相比使用二值掩码,边界伪影更少。
- 该模型在GTX TITAN X GPU上实现SOTA性能,单张图像推理时间仅为34.2 ms。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。