Skip to main content
QUICK REVIEW

[论文解读] OmniMVS: End-to-End Learning for Omnidirectional Stereo Matching

Changhee Won, Jongbin Ryu|arXiv (Cornell University)|Aug 17, 2019
Advanced Vision and Imaging参考文献 5被引用 4
一句话总结

本文提出 OmniMVS,一种用于使用鱼眼图像的全景立体匹配的端到端深度学习框架。它引入了两个合成数据集 OmniThings 和 OmniHouse 用于模型的训练与微调,通过利用几何上下文,在无纹理、反光和遮挡区域实现了最先进性能,且使用灰度输入可获得与 RGB 相当或更优的结果。

ABSTRACT

In this paper, we propose a novel end-to-end deep neural network model for omnidirectional depth estimation from a wide-baseline multi-view stereo setup. The images captured with ultra wide field-of-view (FOV) cameras on an omnidirectional rig are processed by the feature extraction module, and then the deep feature maps are warped onto the concentric spheres swept through all candidate depths using the calibrated camera parameters. The 3D encoder-decoder block takes the aligned feature volume to produce the omnidirectional depth estimate with regularization on uncertain regions utilizing the global context information. In addition, we present large-scale synthetic datasets for training and testing omnidirectional multi-view stereo algorithms. Our datasets consist of 11K ground-truth depth maps and 45K fisheye images in four orthogonal directions with various objects and environments. Experimental results show that the proposed method generates excellent results in both synthetic and real-world environments, and it outperforms the prior art and the omnidirectional versions of the state-of-the-art conventional stereo algorithms.

研究动机与目标

  • 解决在全景鱼眼图像中进行立体匹配的挑战,特别是在无纹理、反光或遮挡区域。
  • 开发一种可在多样化光照和几何环境间泛化的深度学习框架。
  • 证明在真实世界场景中,灰度输入在立体匹配中的表现可与 RGB 相当或更优。
  • 创建并利用模拟真实世界挑战的合成数据集,以训练鲁棒的立体匹配模型。

提出的方法

  • 通过拒绝采样方法随机放置 64 个 ShapeNet 物体(含随机纹理、旋转和缩放),合成 OmniThings 数据集,以确保在球面上的均匀分布。
  • 基于 SUNCG 的室内场景生成 OmniHouse 数据集,随机设置相机位置和朝向,并融入如晴朗天空等真实背景,以模拟真实世界条件。
  • 在 OmniThings 数据集上端到端训练 OmniMVS,使用鱼眼立体图像对和逆深度真值。
  • 在 Sunny 和 OmniHouse 数据集上对 OmniMVS(即 OmniMVS-ft)进行微调,以提升在模糊区域的性能。
  • 应用几何上下文正则化,以改善低纹理或反光区域的匹配代价估计。
  • 使用可微分的渲染流水线生成逼真的鱼眼图像及对应的逆深度图,用于训练。

实验结果

研究问题

  • RQ1端到端的深度学习模型能否在多样化光照和几何条件下实现全景鱼眼图像中鲁棒的立体匹配?
  • RQ2像 OmniThings 和 OmniHouse 这样的合成数据集在多大程度上提升了真实世界立体匹配任务的泛化能力?
  • RQ3在全景系统中,灰度输入是否能实现与 RGB 相当或更优的立体匹配性能?
  • RQ4几何上下文正则化在改善无纹理或反光区域匹配精度方面有多有效?
  • RQ5在领域特定数据集(如 OmniHouse)上进行微调,能否显著提升在具有挑战性的真实世界场景中的性能?

主要发现

  • 在使用灰度输入的情况下,OmniMVS-ft 在 OmniHouse 数据集上的 >1mm 阈值下达到 87.70% 的准确率,优于原始的 PSMNet 和 DispNet-CSS 模型。
  • 在 Sunny 数据集上,OmniMVS-ft 使用灰度输入在 >1mm 阈值下达到 93.24% 的准确率,超过基于 RGB 的基线模型。
  • 使用灰度输入可实现略优或相当的性能,真实世界测试集上的 RMS 误差为 PSMNet 的 4.11–4.20,DispNet-CSS-ft 为 3.44–3.46。
  • 在 OmniHouse 和 Sunny 数据集上进行微调显著提升了在无纹理和反光表面上的性能,将 OmniHouse 数据集上的 MAE 从 7.28 降低至 3.51。
  • OmniThings 数据集可实现有效的预训练,而 OmniHouse 数据集则增强了模型在复杂几何和光照条件下的真实室内场景泛化能力。
  • 该模型在真实鱼眼立体数据上表现出强大的零样本泛化能力,尽管仅在合成数据上训练,但在标准基准测试中仍取得了具有竞争力的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。