Skip to main content
QUICK REVIEW

[论文解读] Spherical View Synthesis for Self-Supervised 360 Depth Estimation

Nikolaos Zioulis, Antonis Karakottas|arXiv (Cornell University)|Sep 17, 2019
Advanced Vision and Imaging参考文献 50被引用 8
一句话总结

本文提出一种基于球面视图合成的自监督方法,用于360°深度估计,通过利用几何推导的视差模型和球面注意力机制,缓解等距柱状投影中的畸变问题。该方法在大规模360°数据集上实现了最先进性能,表明视图合成监督的效果不如直接监督,提示未来可能需要采用其他方法以实现更高质量的深度估计。

ABSTRACT

Learning based approaches for depth perception are limited by the availability of clean training data. This has led to the utilization of view synthesis as an indirect objective for learning depth estimation using efficient data acquisition procedures. Nonetheless, most research focuses on pinhole based monocular vision, with scarce works presenting results for omnidirectional input. In this work, we explore spherical view synthesis for learning monocular 360 depth in a self-supervised manner and demonstrate its feasibility. Under a purely geometrically derived formulation we present results for horizontal and vertical baselines, as well as for the trinocular case. Further, we show how to better exploit the expressiveness of traditional CNNs when applied to the equirectangular domain in an efficient manner. Finally, given the availability of ground truth depth data, our work is uniquely positioned to compare view synthesis against direct supervision in a consistent and fair manner. The results indicate that alternative research directions might be better suited to enable higher quality depth perception. Our data, models and code are publicly available at https://vcl3d.github.io/SphericalViewSynthesis/.

研究动机与目标

  • 通过球面视图合成实现自监督360°深度估计,克服等距柱状投影畸变与监督不一致带来的挑战。
  • 为球面立体设置中的水平、垂直及三目基线,开发一种稳健且基于几何原理的视差模型。
  • 通过引入CoordConv与球面注意力机制,提升CNN在等距柱状图数据上的效率,增强其球面感知能力。
  • 基于一个大规模、多样化的360°深度数据集(含真实深度标注),提供视图合成与直接监督之间的公平、一致比较。
  • 公开发布一个360°立体数据集、模型与代码,以支持可复现性与基准测试。

提出的方法

  • 通过几何推导构建完整的球面视差模型,支持360°场景中的水平、垂直及三目立体配置。
  • 采用带有球面注意力的深度图像渲染(DIBR)生成合成视图,稳定训练过程并减少畸变相关误差。
  • 引入球面注意力图,通过聚焦于相关区域的梯度,减轻等距柱状投影带来的畸变影响,尤其在水平基线中效果显著。
  • 集成CoordConv层,通过注入位置信息增强特征学习,提升在水平与垂直基线上的性能表现。
  • 采用基于几何一致性的逆向映射(inverse warping),但将标准映射替换为DIBR点云投射(splatting),以确保球面范围内监督的一致性。
  • 网络通过新采集的360°数据集中的立体图像对进行端到端训练,监督信号来源于视图合成而非真实深度。

实验结果

研究问题

  • RQ1尽管存在等距柱状投影畸变与本质线奇点问题,球面视图合成是否仍可有效用于自监督360°深度估计?
  • RQ2在大规模360°数据集上进行公平、一致的评估时,视图合成监督与直接监督的性能表现如何比较?
  • RQ3球面注意力与CoordConv在提升等距柱状输入上的深度估计性能中分别起到何种作用?
  • RQ4基线选择(水平、垂直、三目)是否显著影响自监督360°深度估计的质量?
  • RQ5自监督视图合成是否是实现高质量360°深度估计的可行路径?抑或采用合成数据或更优数据采集方法更为有效?

主要发现

  • 所提方法在SunCG数据集上达到最先进性能,UD基线的相对误差为0.119,delta1准确率为66.4%。
  • 球面注意力在LR基线中显著提升性能(无注意力RMSE: 0.269,有注意力RMSE: 0.143),但在UD基线中影响甚微。
  • CoordConv在UD基线中提升性能(无CoordConv RMSE: 0.138,有CoordConv RMSE: 0.134),表明其在垂直设置中更优地处理了空间几何关系。
  • 在更具多样性的SunCG测试集上,该模型表现优于[41],delta1准确率达72.2%,而[41]在PanoSunCG上仅为64.7%,尽管[41]在更小、更少样化的数据集上略优。
  • 视图合成与直接监督的对比结果表明,直接监督显著优于自监督,提示自监督可能并非实现高精度360°深度估计的最优路径。
  • 作者公开发布了一个大规模、可公开访问的360°立体数据集及代码,为未来基准测试与可复现性研究提供支持。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。