QUICK REVIEW
[论文解读] Surface Normals in the Wild
Weifeng Chen, Donglai Xiang|arXiv (Cornell University)|Apr 10, 2017
Advanced Vision and Imaging参考文献 1被引用 4
一句话总结
本文介绍了野外表面法线数据集(Surface Normals in the Wild, SNOW),这是一个大规模的众包表面法线标注集合,适用于开放场景下的图像。本文提出了两种新颖的损失函数——角度差异损失和深度导数比较损失,利用表面法线来提升单目深度估计性能,在NYU Depth和SNOW数据集上均显著优于以往方法。
ABSTRACT
We study the problem of single-image depth estimation for images in the wild. We collect human annotated surface normals and use them to train a neural network that directly predicts pixel-wise depth. We propose two novel loss functions for training with surface normal annotations. Experiments on NYU Depth and our own dataset demonstrate that our approach can significantly improve the quality of depth estimation in the wild.
研究动机与目标
- 为解决相对深度标注在捕捉开放场景中表面几何结构和感知保真度方面的局限性。
- 开发一种实用的众包方法,用于为多样化的真实世界图像收集表面法线标注。
- 利用表面法线标注作为监督信号,训练深度神经网络以实现度量深度预测。
- 评估表面法线监督在真实和合成数据集上提升深度估计质量的有效性。
提出的方法
- 设计了一种用户界面,允许标注者通过调整虚拟箭头和切平面来估计表面法线,从而实现对真实世界图像中表面法线的可靠众包标注。
- 从Flickr图像中收集了60,061个表面法线标注,构建了用于训练和评估的SNOW数据集。
- 提出了一种新颖的角度差异损失,通过最小化预测法线与真实法线之间的夹角,以提升几何保真度。
- 开发了一种基于深度导数的损失,通过比较预测深度与从真实法线推导出的深度导数,以增强深度不连续性的准确性。
- 使用表面法线监督与标准深度监督相结合的方式训练深度卷积神经网络,并通过消融实验评估不同策略之间的权衡。
- 在SNOW数据集上对模型进行微调,以适应多样化、开放场景的图像,展示了更强的泛化能力和更高的表面法线预测精度。
实验结果
研究问题
- RQ1来自人类众包的表面法线标注能否提升开放、真实世界图像中的深度估计性能?
- RQ2在捕捉连续性和曲率等感知上重要的三维几何结构方面,表面法线标注与相对深度标注相比有何差异?
- RQ3在深度估计中,角度差异损失与基于深度导数的损失相比,各自具有哪些相对优势?
- RQ4当缺乏真实深度监督时,表面法线监督能否显著提升深度预测性能?
- RQ5在SNOW数据集上进行微调在多大程度上提升了模型对开放场景图像的泛化能力?
主要发现
- 所提出的基于表面法线的损失函数在NYU Depth数据集上显著提升了深度估计质量,最佳模型(d_n_al_F)在角度距离和阈值内百分比指标上均优于SOTA方法(如Wang [31])。
- 在SNOW数据集上对d_n_al_F模型进行微调(d_n_al_F_SNOW)后,平均角度误差降低至25.75°,在11.25°以内的法线比例提升了21.66%,在30°以内的法线比例提升了67.88%,表明其在真实世界场景中具有极强的泛化能力。
- 仅在SNOW上训练的模型(Ours_NYU_SNOW§)实现了23.33°的平均角度误差,且72.74%的法线在30°以内,优于SNOW基准上的SOTA表面法线估计模型。
- 基于深度导数的损失在保持深度不连续性方面更为有效,而角度损失则更有利于保持表面朝向的保真度,表明两者在不同应用场景中存在明确的权衡。
- SNOW数据集支持有效的迁移学习,微调后的模型在表面法线预测精度上相比基线模型有显著提升。
- 图7的定性结果表明,所提方法在多样化、开放场景图像中生成了更具感知保真度的深度预测结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。