Skip to main content
QUICK REVIEW

[论文解读] 360SD-Net: 360° Stereo Depth Estimation with Learnable Cost Volume

Ning-Hsu Wang, Bolivar Solarte|arXiv (Cornell University)|Nov 11, 2019
Advanced Vision and Imaging参考文献 35被引用 7
一句话总结

360SD-Net 提出了一种端到端的深度学习框架,用于使用上下双视角等距投影图像对进行360°立体深度估计,通过可学习的代价体积和极角编码来缓解畸变。该方法在合成的360°立体数据集上实现了最先进性能,并能有效泛化到使用消费级相机拍摄的真实场景。

ABSTRACT

Recently, end-to-end trainable deep neural networks have significantly improved stereo depth estimation for perspective images. However, 360° images captured under equirectangular projection cannot benefit from directly adopting existing methods due to distortion introduced (i.e., lines in 3D are not projected onto lines in 2D). To tackle this issue, we present a novel architecture specifically designed for spherical disparity using the setting of top-bottom 360° camera pairs. Moreover, we propose to mitigate the distortion issue by (1) an additional input branch capturing the position and relation of each pixel in the spherical coordinate, and (2) a cost volume built upon a learnable shifting filter. Due to the lack of 360° stereo data, we collect two 360° stereo datasets from Matterport3D and Stanford3D for training and evaluation. Extensive experiments and ablation study are provided to validate our method against existing algorithms. Finally, we show promising results on real-world environments capturing images with two consumer-level cameras.

研究动机与目标

  • 解决等距投影360°图像中严重的畸变问题,该问题阻碍了标准立体深度方法的直接应用。
  • 设计一种专为上下双视角360°相机配置定制的新型深度学习架构,以保持视差线对齐。
  • 通过整合球面坐标信息(极角)和可学习的平移滤波器,在代价体积构建中减轻几何畸变的影响。
  • 收集并发布两个新的360°立体数据集(MP3D 和 SF3D),包含真实深度/视差标签,用于训练和评估。
  • 展示在合成数据上训练的模型在使用消费级360°相机拍摄的真实环境中具有良好的泛化能力。

提出的方法

  • 引入双分支输入流:一个用于RGB图像特征,另一个用于极角编码,以建模球面投影中的空间畸变。
  • 提出一种可学习代价体积(LCV)模块,使用可学习的平移滤波器替代固定的像素位移,实现在不同畸变水平下的自适应代价聚合。
  • 集成空洞空间金字塔池化(ASPP)和复制填充(replicated padding),以增强多尺度特征学习和边界处理能力。
  • 使用视差和深度的监督损失进行端到端训练,并通过数据增强提升模型鲁棒性。
  • 采用上下双视角相机配置,使视差线在图像中垂直对齐,从而简化等距投影空间中的对应关系搜索。
  • 利用Matterport3D和Stanford3D的合成数据进行模型训练,并通过领域自适应实现对真实世界场景的泛化。

实验结果

研究问题

  • RQ1在严重几何畸变下,可学习代价体积机制是否能优于标准的固定位移代价体积?
  • RQ2在等距投影360°图像上,引入极角信息在多大程度上能提升深度估计的准确性?
  • RQ3在合成360°立体数据上训练的模型,其在使用消费级360°相机拍摄的真实世界环境中的泛化能力如何?
  • RQ4可学习平移滤波器的最优初始步长是多少?其对性能有何影响?
  • RQ5与经典方法和深度学习立体匹配方法相比,所提出的架构是否在360°数据上实现了最先进性能?

主要发现

  • 360SD-Net 在 MP3D 和 SF3D 合成360°立体数据集上实现了最先进性能,无论在深度估计还是视差估计方面均优于 PSMNet 和 GCNet。
  • 消融实验证实,极角编码在 MP3D 数据集上将相对误差降低 1.2%,绝对误差降低 0.8%。
  • 初始步长为 1/3° 的可学习代价体积(LCV)达到最佳性能,相比固定位移基线方法提升 1.5%。
  • 模型在真实世界场景中表现出良好的泛化能力:两台 Insta360 ONE X 相机捕获的深度图展现出清晰的物体结构和精确的点云重建,即使存在领域差异。
  • 定性结果表明,深度图更清晰,3D几何结构更准确,尤其在高畸变区域和物体边界处表现更优。
  • 与 PSMNet 相比,该模型仅引入轻微的运行时开销,但性能显著更优,表明其在效率与精度之间具有出色的平衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。