Skip to main content
QUICK REVIEW

[论文解读] 3D Shape Perception from Monocular Vision, Touch, and Shape Priors

Shaoxiong Wang, Jiajun Wu|arXiv (Cornell University)|Aug 9, 2018
Tactile and Sensory Interactions参考文献 43被引用 8
一句话总结

本文提出了一种混合3D形状重建方法,通过融合单目RGB视觉、GelSight传感器的触觉感知以及学习到的形状先验,实现了高精度且高效的3D物体感知。通过使用深度学习从单张图像预测初始形状,并主动选择高不确定性区域进行触觉精炼,该系统仅需5–10次触碰即可实现高保真度的3D重建,在速度和精度上显著优于基线方法。

ABSTRACT

Perceiving accurate 3D object shape is important for robots to interact with the physical world. Current research along this direction has been primarily relying on visual observations. Vision, however useful, has inherent limitations due to occlusions and the 2D-3D ambiguities, especially for perception with a monocular camera. In contrast, touch gets precise local shape information, though its efficiency for reconstructing the entire shape could be low. In this paper, we propose a novel paradigm that efficiently perceives accurate 3D object shape by incorporating visual and tactile observations, as well as prior knowledge of common object shapes learned from large-scale shape repositories. We use vision first, applying neural networks with learned shape priors to predict an object's 3D shape from a single-view color image. We then use tactile sensing to refine the shape; the robot actively touches the object regions where the visual prediction has high uncertainty. Our method efficiently builds the 3D shape of common objects from a color image and a small number of tactile explorations (around 10). Our setup is easy to apply and has potentials to help robots better perform grasping or manipulation tasks on real-world objects.

研究动机与目标

  • 为解决单目视觉在3D形状感知中的局限性,如遮挡和2D-3D歧义,特别是针对透明或反光物体。
  • 克服纯触觉形状重建的低效性,后者需要大量局部测量才能推断全局几何结构。
  • 将视觉、触觉和学习到的形状先验整合到统一框架中,实现鲁棒且高效的3D重建。
  • 开发一种主动探索策略,选择最优触点以最小化不确定性并减少所需的触觉交互次数。
  • 证明单张RGB图像与少量触觉触碰即可实现对常见现实世界物体的精确3D重建。

提出的方法

  • 该方法使用在大规模3D CAD模型及其RGB-D渲染图像上训练的深度神经网络,从单张单目彩色图像预测3D体素化形状,利用隐式形状先验。
  • 通过GelSight传感器获取的触觉数据用于获得高分辨率的局部表面几何信息,随后利用学习到的形状先验将其全局整合到形状预测中。
  • 主动探索策略基于预测不确定性选择触点,优先选择视觉置信度较低的区域,以最大化信息增益。
  • 系统使用内在图像作为中间表示,统一视觉与触觉信号,实现在不同模态间的一致性融合。
  • 通过形状先验进行全局形状精炼,而非局部体素更新,从而提升一致性与收敛性。
  • 该模型在真实世界物体上进行评估,包括透明和反光物体,且支持RGB与RGB-D输入。

实验结果

研究问题

  • RQ1机器人能否仅使用单张RGB图像和少量触觉触碰实现精确的3D形状重建?
  • RQ2将学习到的形状先验融入多模态输入中,如何提升3D重建的效率与精度?
  • RQ3与随机或贪心策略相比,主动探索策略能否显著减少所需的触觉交互次数?
  • RQ4不同形状先验——在通用形状上训练 vs. 在特定类别上训练——如何影响重建质量与收敛速度?
  • RQ5在不依赖深度传感器的情况下,该系统在多大程度上能够重建具有挑战性的物体,如透明或高度反光的物体?

主要发现

  • 所提方法仅需5–10次触觉触碰即可实现高精度3D形状重建,与基线方法相比显著减少了交互次数。
  • 在5–10次触碰内,预测形状与真实形状之间的Chamfer距离降至接近人类表现水平,表明收敛迅速。
  • 主动探索策略相比随机触点选择,将所需触碰次数减少了高达50%,定量Chamfer距离对比结果证实了这一点。
  • 使用在类似盒子形状物体上训练的形状先验,可提升对相似物体(如糖盒)的重建精度,凸显了类别特定先验的优势。
  • 在深度传感器失效的透明和反光物体上,系统表现出鲁棒性,依赖视觉与触觉融合实现重建。
  • 消融实验确认,形状先验与主动策略均不可或缺:移除任一因素均导致收敛速度显著变慢且最终精度明显下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。