Skip to main content
QUICK REVIEW

[论文解读] Depth Estimation on Underwater Omni-directional Images Using a Deep Neural Network

Haofei Kuang, Qingwen Xu|arXiv (Cornell University)|May 22, 2019
Advanced Vision and Imaging参考文献 26被引用 4
一句话总结

本文提出一种球面全卷积残差神经网络(spherical FCRN),用于从水下全向图像中估计深度,通过经度-纬度映射将预训练的空气中FCRN适配至水下场景。基于合成生成的水下数据集,该方法在合成数据上实现了可接受的深度估计性能,但因图像风格和深度范围的域偏移,其在真实水下图像上的泛化能力仍有限。

ABSTRACT

In this work, we exploit a depth estimation Fully Convolutional Residual Neural Network (FCRN) for in-air perspective images to estimate the depth of underwater perspective and omni-directional images. We train one conventional and one spherical FCRN for underwater perspective and omni-directional images, respectively. The spherical FCRN is derived from the perspective FCRN via a spherical longitude-latitude mapping. For that, the omni-directional camera is modeled as a sphere, while images captured by it are displayed in the longitude-latitude form. Due to the lack of underwater datasets, we synthesize images in both data-driven and theoretical ways, which are used in training and testing. Finally, experiments are conducted on these synthetic images and results are displayed in both qualitative and quantitative way. The comparison between ground truth and the estimated depth map indicates the effectiveness of our method.

研究动机与目标

  • 解决水下环境中图像因模糊、色彩偏移和散射效应导致的深度估计挑战。
  • 通过数据驱动和理论方法合成训练数据,克服真实水下全向图像数据集稀缺的问题。
  • 通过球面坐标映射,将预训练的空气中深度估计网络(FCRN)适配至全向水下图像使用。
  • 在合成与真实水下数据集上评估适配网络的性能,以评估其泛化能力。

提出的方法

  • 在通过风格迁移网络(WaterGAN)生成的合成水下透视图像上训练传统FCRN,该网络模拟了水下色彩偏移和模糊效果。
  • 通过将全向相机建模为球面,并将图像投影至经度-纬度坐标,将透视FCRN转换为球面FCRN。
  • 应用球面坐标映射,使标准卷积层能够在无失真的情况下处理全向图像特征。
  • 由于大尺寸全向图像输入带来的计算限制,采用ResNet-18替代ResNet-50的FCRN变体。
  • 通过在空气中全向图像上施加与深度相关的模糊和红色通道衰减,合成全向水下图像。
  • 在带有对应真实深度图的合成全向水下图像上端到端训练球面FCRN。

实验结果

研究问题

  • RQ1预训练的空气中深度估计网络(FCRN)能否有效适配至水下全向图像?
  • RQ2与在透视图像上的表现相比,球面FCRN在合成水下全向图像上的表现如何?
  • RQ3将基于合成数据训练的网络迁移到真实世界水下全向图像时存在哪些局限性?
  • RQ4在深度估计精度和推理速度方面,球面FCRN与原始FCRN相比表现如何?
  • RQ5域偏移(如图像色彩、模糊程度和深度范围差异)在多大程度上影响模型在真实数据上的泛化能力?

主要发现

  • 传统FCRN在合成水下透视图像上表现优异,RMSE为0.162,MAE为0.117,REL为0.098,δ₁为0.914。
  • 球面FCRN在合成水下全向图像上取得了可接受的结果,RMSE为0.604,MAE为0.362,REL为0.172,δ₁为0.711。
  • 尽管在全向图像上的性能较低,球面FCRN仍能对大多数像素成功估计深度,表明球面适配方法的可行性。
  • 在Berman等人提供的真实水下图像上测试时性能下降,部分区域预测不准确,可能由于色彩色调和深度范围的域偏移所致。
  • 球面FCRN在GPU上的平均单张图像推理时间为0.0145秒,表明即使在模型复杂度较高的情况下,仍具备高效的推理能力。
  • 合成数据与真实数据之间的性能差距凸显了需要更丰富的合成数据,以及在真实数据上进行微调,以提升模型鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。