Skip to main content
QUICK REVIEW

[论文解读] Deep Convolutional Neural Network for 6-DOF Image Localization

Daoyuan Jia, Yongchi Su|arXiv (Cornell University)|Nov 8, 2016
Advanced Neural Network Applications参考文献 19被引用 5
一句话总结

本文提出一种用于6-DOF图像定位的深度卷积神经网络(ConvNet),通过从3D点云模型生成数十万张合成的、自标注的图像来端到端训练位姿回归。该方法在真实测试图像上实现了1.01米的位置误差和0.98°的朝向误差,显著优于先前方法,得益于利用合成数据和预训练模型增强了对光照和季节变化的鲁棒性。

ABSTRACT

We present an accurate and robust method for six degree of freedom image localization. There are two key-points of our method, 1. automatic immense photo synthesis and labeling from point cloud model and, 2. pose estimation with deep convolutional neural networks regression. Our model can directly regresses 6-DOF camera poses from images, accurately describing where and how it was captured. We achieved an accuracy within 1 meters and 1 degree on our out-door dataset, which covers about 2 acres on our school campus.

研究动机与目标

  • 解决基于深度学习的图像定位任务中大规模、精确标注的6-DOF训练数据稀缺的问题。
  • 开发一种端到端的深度ConvNet流水线,直接从图像回归6-DOF相机位姿,无需依赖手工设计的特征。
  • 提升对光照和季节变化的鲁棒性,这些因素通常会降低基于特征描述子方法的性能。
  • 通过在某一场景上训练模型并在另一场景上应用时仅需少量微调,实现迁移学习。
  • 通过从3D重建生成合成的、精确标注的图像,克服‘真实位姿困境’。

提出的方法

  • 使用渲染技术与着色器,从3D点云模型合成数十万张逼真的、带6-DOF标注的‘照片’,以模拟多样的光照和天气条件。
  • 使用预训练的ImageNet模型(CaffeNet、GoogLeNet、VGG16)作为初始化,以加速训练并改善收敛性。
  • 修改网络的最后全连接层,使其输出6-DOF位姿(3D位置和3D旋转作为四元数),并提高学习率放大倍数。
  • 通过图像镜像和均值减法进行数据增强,以提升泛化能力,同时避免产生无效的对称样本对。
  • 使用随机梯度下降进行网络训练,配合学习率衰减、因GPU显存限制而采用的批量累积,以及按不同网络架构微调的学习率。
  • 在VGG16中引入中间损失层,以增强梯度流动并提高训练稳定性。

实验结果

研究问题

  • RQ1从3D点云生成的合成自标注图像是否能显著提升基于深度学习的6-DOF图像定位的准确性和鲁棒性?
  • RQ2端到端深度ConvNet回归方法在准确性和效率方面与传统特征匹配或SLAM方法相比如何?
  • RQ3在某一场景上训练的模型在迁移到另一场景时,其性能和收敛速度受多大程度的影响?
  • RQ4在光照和季节条件变化较大的情况下,该方法是否能保持高精度,而传统特征描述子(如SIFT)会失效?
  • RQ5尽管真实世界训练图像有限,使用预训练模型和合成数据是否能缓解姿态回归中的过拟合问题?

主要发现

  • 在校园体育场场景的真实测试图像(TestsetA)上,该方法实现了1.01米的平均位置误差和0.98度的朝向误差,其朝向精度比PoseNet*高出10倍以上。
  • 在合成测试图像(TestsetB)上,该方法实现了0.93米的位置误差和0.42度的朝向误差,表明其对未见过但逼真的图像条件具有强大的泛化能力。
  • 经过真实训练帧微调的GoogLePose†模型在TestsetB上实现了0.91米和0.39度的误差,表明结合真实与合成数据可显著提升性能。
  • 迁移学习实验表明,预先在某一场景上训练的模型在应用于新场景时收敛所需训练周期更少,提升了训练效率。
  • 由于在合成阶段进行了数据增强,该方法对光照和季节变化表现出鲁棒性,在复杂光照条件下优于基于SIFT的方法。
  • 利用点云生成的合成数据解决了‘真实位姿困境’,实现了大规模、精确的标注,而无需依赖GPS或人工标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。