[论文解读] IRS: A Large Naturalistic Indoor Robotics Stereo Dataset to Train Deep Models for Disparity and Surface Normal Estimation
本论文提出 IRS,一个大规模合成室内立体数据集,包含超过 100,000 幅立体 RGB 图像,以及高保真的视差和表面法线真实值,通过定制的 Unreal Engine 4 渲染管道生成,以模拟逼真的视觉效果。在 IRS 上训练的两阶段 DTN-Net 模型在表面法线估计任务中达到最先进性能,在合成数据集和真实世界基准测试中均优于现有方法。
Indoor robotics localization, navigation, and interaction heavily rely on scene understanding and reconstruction. Compared to the monocular vision which usually does not explicitly introduce any geometrical constraint, stereo vision-based schemes are more promising and robust to produce accurate geometrical information, such as surface normal and depth/disparity. Besides, deep learning models trained with large-scale datasets have shown their superior performance in many stereo vision tasks. However, existing stereo datasets rarely contain the high-quality surface normal and disparity ground truth, which hardly satisfies the demand of training a prospective deep model for indoor scenes. To this end, we introduce a large-scale synthetic but naturalistic indoor robotics stereo (IRS) dataset with over 100K stereo RGB images and high-quality surface normal and disparity maps. Leveraging the advanced rendering techniques of our customized rendering engine, the dataset is considerably close to the real-world captured images and covers several visual effects, such as brightness changes, light reflection/transmission, lens flare, vivid shadow, etc. We compare the data distribution of IRS with existing stereo datasets to illustrate the typical visual attributes of indoor scenes. Besides, we present DTN-Net, a two-stage deep model for surface normal estimation. Extensive experiments show the advantages and effectiveness of IRS in training deep models for disparity estimation, and DTN-Net provides state-of-the-art results for normal estimation compared to existing methods.
研究动机与目标
- 解决室内机器人应用中缺乏大规模、高质量的立体数据集,且缺乏密集视差和表面法线标注的问题。
- 克服现有合成数据集缺乏真实视觉属性(如镜头光晕、光反射和间接阴影)的局限性。
- 开发一个基于 IRS 训练的深度学习框架,以提升在真实世界室内场景中视差和表面法线估计的泛化能力和准确性。
- 证明在 IRS 上训练的模型相比在 FlyingThings3D 等合成数据集上训练的模型,对复杂真实世界视觉效果的泛化能力更强。
提出的方法
- 使用定制的 Unreal Engine 4 渲染管道,生成大规模室内立体数据集(IRS),并结合先进渲染技术。
- 引入逼真的视觉效果,包括亮度变化、光反射/透射、镜头光晕和鲜明阴影,以增强真实感。
- 收集超过 100,000 对立体 RGB 图像,配以密集的真实视差图和表面法线图。
- 设计 DTN-Net,一种两阶段深度神经网络,先预测视差,再利用预测的视差图优化表面法线。
- 在 IRS 上训练和评估模型,并与真实世界数据集(Middlebury、KITTI)进行对比,以评估泛化能力和准确性。
- 使用数据增强和域适应技术,提升模型对真实世界视觉变化的鲁棒性。
实验结果
研究问题
- RQ1具有逼真视觉属性的合成立体数据集是否能提升深度学习模型在真实室内场景中视差和表面法线估计的泛化能力?
- RQ2在亮度、光照和光学效果方面,IRS 的视觉真实感与现有合成数据集(如 FlyingThings3D)相比如何?
- RQ3与在其他合成数据集上训练相比,在 IRS 上训练在真实世界立体基准测试中的性能提升程度如何?
- RQ4利用预测视差图来优化表面法线的两阶段深度学习模型(DTN-Net)是否优于现有的仅使用 RGB 或融合深度信息的模型?
- RQ5在训练数据中包含真实视觉伪影(如镜头光晕、反射)是否能提升模型在具有挑战性的真实世界场景中的预测鲁棒性?
主要发现
- 在 Middlebury 数据集上,基于 IRS 训练的模型(如 FADNet(IRS))的平均端到端误差显著降低至 1.86,而 FADNet(FT3D) 的误差为 2.68,表明泛化能力更优。
- DTN-Net 在 IRS 数据集上的平均角度误差为 10.64°,优于 NormNetS(13.93°)和 DFN-Net(12.81°),且 74.1% 的像素误差低于 11.25°。
- 在使用 Intel RealSense D435i 拍摄的真实世界图像上,DTN-Net 和 FADNet 在 IRS 上训练后,仍能生成一致且准确的表面法线图和视差图,即使在反光和纹理复杂的表面上也表现良好。
- 定性结果表明,与在 FlyingThings3D 上训练的模型相比,在 IRS 上训练的模型能更稳健地处理镜头光晕和镜面反射等复杂视觉效果。
- IRS 结合逼真渲染与高质量真实值,使其在合成与真实世界基准测试中的性能均优于现有数据集。
- 两阶段 DTN-Net 架构通过利用视差信息优化法线,实现了最先进性能,证明了在深度学习模型中引入几何先验的显著价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。