Skip to main content
QUICK REVIEW

[论文解读] Deep Visuo-Tactile Learning: Estimation of Tactile Properties from Images

Kuniyuki Takahashi, Jethro Tan|arXiv (Cornell University)|Mar 9, 2018
Tactile and Sensory Interactions参考文献 29被引用 5
一句话总结

本文提出了一种深度视觉触觉学习框架,仅通过RGB图像即可估计连续的触觉属性(如滑溜性和粗糙度),采用具有联合视觉-触觉潜在空间的无监督自编码器。该模型无需人工标注即可泛化到未见过的材料,在真实世界数据(来自Sawyer机器人上的网络摄像头和uSkin触觉传感器)上进行端到端训练,实现精确估计。

ABSTRACT

Estimation of tactile properties from vision, such as slipperiness or roughness, is important to effectively interact with the environment. These tactile properties help us decide which actions we should choose and how to perform them. E.g., we can drive slower if we see that we have bad traction or grasp tighter if an item looks slippery. We believe that this ability also helps robots to enhance their understanding of the environment, and thus enables them to tailor their actions to the situation at hand. We therefore propose a model to estimate the degree of tactile properties from visual perception alone (e.g., the level of slipperiness or roughness). Our method extends a encoder-decoder network, in which the latent variables are visual and tactile features. In contrast to previous works, our method does not require manual labeling, but only RGB images and the corresponding tactile sensor data. All our data is collected with a webcam and uSkin tactile sensor mounted on the end-effector of a Sawyer robot, which strokes the surfaces of 25 different materials. We show that our model generalizes to materials not included in the training data by evaluating the feature space, indicating that it has learned to associate important tactile properties with images.

研究动机与目标

  • 使机器人仅通过视觉输入即可估计触觉属性(如滑溜性和粗糙度),从而改善与环境的交互。
  • 克服离散分类方法的局限性,后者需要大量标注数据且无法捕捉触觉属性的连续程度。
  • 学习一个连续且解耦的潜在空间,以捕捉触觉属性的程度,而无需依赖人工定义的类别标签。
  • 仅使用RGB图像和原始触觉传感器数据进行训练,从而实现在模拟环境或离线设置中部署,而无需实时触觉传感。
  • 通过分析所学潜在空间的结构,展示模型对训练期间未见的新材料的泛化能力。

提出的方法

  • 提出一种具有共享潜在变量的深度编码器-解码器网络,用于视觉和触觉特征,基于配对的RGB图像和触觉传感器序列进行端到端训练。
  • 对图像输入使用2D卷积编码器,对时序触觉数据使用3D卷积编码器,两者均投影到共享的连续潜在空间。
  • 在共享潜在空间中嵌入视觉和触觉特征,使模型能够在无显式触觉标签监督的情况下学习跨模态表示。
  • 在所有层中应用批量归一化以及ReLU/Tanh激活函数,使用Adam优化器和均方误差损失进行重建。
  • 使用安装在Sawyer机器人上的网络摄像头和uSkin触觉传感器采集的数据进行训练,通过在25种材料上进行受控的刮擦运动获取数据。
  • 训练完成后,可在模拟环境或离线设置中进行推理,因为最终模型不再需要实时触觉输入。

实验结果

研究问题

  • RQ1深度神经网络能否仅从RGB图像中学习估计连续触觉属性(如粗糙度、滑溜性),而无需人工标注?
  • RQ2所学潜在空间是否能泛化到训练数据中未出现的材料,表明对触觉属性程度的稳健表示?
  • RQ3与离散分类基线相比,连续潜在空间模型在捕捉触觉属性变化方面的性能如何?
  • RQ4该模型能否在连续且可解释的潜在空间中解耦并表示不同的触觉属性(如摩擦力、纹理)?
  • RQ5视觉感知在多大程度上可以单独预测触觉反馈,特别是对于视觉外观相似但触觉行为不同的材料?

主要发现

  • 该模型在潜在空间中成功泛化到未见过的材料,相似材料聚类在一起,新材料被映射到基于触觉相似性的合理区域。
  • 潜在变量 $ z_2 $ 与摩擦特性相关:摩擦力较低的材料(如光泽表面如气泡膜)被映射到较低的 $ z_2 $ 值,表明模型成功学习了滑溜性的表示。
  • 所提出的连续潜在空间模型($ N_{\textsc{proposed}} $)比离散分类模型($ N_{\textsc{classification}} $)更有效地捕捉触觉属性的程度,后者无法表达连续变化。
  • 分类模型在潜在空间中产生明显分离的聚类,但无法表示触觉属性的程度,而所提方法的连续表示则能实现这一点。
  • 该模型能够从2D图像中准确估计触觉属性,尽管对于具有极端触觉特性的材料(如极高粗糙度)存在局限,这是由于2D投影导致的信息损失。
  • 分类模型的训练时间约为五分钟,而所提方法无需类别标签,且无需微调即可实现更优的泛化性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。