Skip to main content
QUICK REVIEW

[论文解读] Transfer Learning From Synthetic To Real Images Using Variational Autoencoders For Precise Position Detection

Tadanobu Inoue, Subhajit Chaudhury|arXiv (Cornell University)|Jul 4, 2018
Robotics and Sensor-Based Localization被引用 9
一句话总结

本文提出一种基于变分自编码器(VAEs)的迁移学习方法,通过利用大规模合成数据和少量真实图像数据集,实现在真实世界图像中的精确目标位置检测。该方法训练两个VAE将合成图像和真实图像映射到共享潜在空间,使卷积神经网络(CNN)能够在域间泛化,在真实世界检测任务中实现1.5–3.5 mm的平均精度,包括在光照变化和干扰物存在的条件下仍保持稳定表现。

ABSTRACT

Capturing and labeling camera images in the real world is an expensive task, whereas synthesizing labeled images in a simulation environment is easy for collecting large-scale image data. However, learning from only synthetic images may not achieve the desired performance in the real world due to a gap between synthetic and real images. We propose a method that transfers learned detection of an object position from a simulation environment to the real world. This method uses only a significantly limited dataset of real images while leveraging a large dataset of synthetic images using variational autoencoders. Additionally, the proposed method consistently performed well in different lighting conditions, in the presence of other distractor objects, and on different backgrounds. Experimental results showed that it achieved accuracy of 1.5mm to 3.5mm on average. Furthermore, we showed how the method can be used in a real-world scenario like a "pick-and-place" robotic task.

研究动机与目标

  • 解决物体检测任务中合成图像与真实世界图像之间的‘现实差距’问题。
  • 通过利用大规模合成数据集,减少对昂贵真实世界数据采集的依赖。
  • 仅使用少量真实图像,实现在真实世界场景中的精确物体位置检测。
  • 在推理过程中对光照变化、背景和干扰物保持鲁棒性。
  • 在实际机器人系统(如抓取与放置任务)中验证方法的适用性。

提出的方法

  • 在合成RGB-D图像上训练一个VAE(VAE1),以学习合成数据的共享潜在表征。
  • 使用真实图像微调第二个VAE(VAE2),固定VAE1的解码器权重,以对齐真实图像与合成图像的潜在空间。
  • 利用共享解码器从真实图像生成伪合成图像,实现跨域特征迁移。
  • 在VAE1生成的合成数据输出上训练卷积神经网络(CNN),以预测物体位置。
  • 在推理阶段,将训练好的CNN部署于VAE2生成的来自真实图像的伪合成图像上,无需重新训练。
  • 利用不变的潜在空间,在多种真实世界条件下保持检测性能稳定。

实验结果

研究问题

  • RQ1基于VAE的域自适应方法能否有效缩小合成图像与真实图像在物体位置检测任务中的现实差距?
  • RQ2当通过基于VAE的特征对齐将小规模真实图像数据集与大规模合成数据结合时,检测精度能提升到何种程度?
  • RQ3该方法对光照条件变化、背景纹理差异以及干扰物的鲁棒性如何?
  • RQ4该方法能否在不重新训练的情况下泛化到复杂且具有纹理的真实世界物体?
  • RQ5该方法能否在高精度要求的真实机器人抓取与放置任务中成功应用?

主要发现

  • 仅使用有限数量的真实图像,该方法在真实世界图像上的平均位置检测精度达到1.5–3.5 mm。
  • 模型在多种光照条件下均保持高性能,表现出对光照变化的强鲁棒性。
  • 该方法能有效忽略干扰物,在存在多个物体的情况下仍能准确定位目标物体。
  • VAE2模型仅选择性地重建目标物体,有效抑制了背景和干扰物特征。
  • 该方法在未见过的背景(如黑色纸张和方格图案)上也实现了泛化,且无需重新训练。
  • 该方法已在真实世界机器人抓取与放置任务中成功验证,相关成果已在公开视频中展示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。