Skip to main content
QUICK REVIEW

[论文解读] Connecting Look and Feel: Associating the visual and tactile properties of physical materials

Wenzhen Yuan, Shaoxiong Wang|arXiv (Cornell University)|Apr 12, 2017
Tactile and Sensory Interactions参考文献 21被引用 13
一句话总结

本文提出了一种多模态深度学习框架,通过联合训练视觉(颜色和深度图像)与触觉(GelSight传感器)数据,学习织物的共享嵌入向量,从而实现对织物属性的准确跨模态预测。关键贡献在于,与触觉数据联合训练显著提升了仅基于视觉的匹配性能,即使在仅使用视觉进行测试时亦然,表明触觉输入可增强视觉表征学习,提升材料理解能力。

ABSTRACT

For machines to interact with the physical world, they must understand the physical properties of objects and materials they encounter. We use fabrics as an example of a deformable material with a rich set of mechanical properties. A thin flexible fabric, when draped, tends to look different from a heavy stiff fabric. It also feels different when touched. Using a collection of 118 fabric sample, we captured color and depth images of draped fabrics along with tactile data from a high resolution touch sensor. We then sought to associate the information from vision and touch by jointly training CNNs across the three modalities. Through the CNN, each input, regardless of the modality, generates an embedding vector that records the fabric's physical property. By comparing the embeddings, our system is able to look at a fabric image and predict how it will feel, and vice versa. We also show that a system jointly trained on vision and touch data can outperform a similar system trained only on visual data when tested purely with visual inputs.

研究动机与目标

  • 通过关联视觉与触觉感知,使机器能够理解物理材料属性。
  • 学习一个共享嵌入空间,使同一织物的视觉与触觉信号在该空间中彼此接近,反映其潜在物理参数。
  • 探究触觉数据是否能够提升视觉表征学习以实现材料识别。
  • 评估数据增强、在褶皱处触觉采样以及人工标注聚类对嵌入质量的影响。
  • 证明跨模态联合学习优于仅基于视觉的单模态训练。

提出的方法

  • 系统使用三个独立的CNN(基于AlexNet)分别处理颜色图像、深度图像和GelSight触觉图像,每个网络生成一个4096维的嵌入向量。
  • 采用跨模态损失函数,最小化同一织物在所有三种模态之间嵌入向量的L2距离之和:$ D_3 = \|\mathbf{E}_1 - \mathbf{E}_2\| + \|\mathbf{E}_1 - \mathbf{E}_3\| + \|\mathbf{E}_3 - \mathbf{E}_2\| $。
  • 网络在118种织物样本上进行联合训练,每种织物均以悬挂状态的颜色/深度图像以及从褶皱区域获取的多张GelSight触觉图像进行采集。
  • 通过伽马校正(0.5–2.0)和RGB通道重排对颜色图像应用数据增强,以提升鲁棒性。
  • 采用Siamese神经网络(SNN)作为视觉匹配的基线模型,并与同时使用深度图像和GelSight输入训练的跨模态网络进行性能比较。
  • 使用人工标注的织物聚类作为辅助监督信号,引导网络学习更具语义意义的嵌入表示。

实验结果

研究问题

  • RQ1深度神经网络能否学习一个共享嵌入空间,从而从视觉与触觉模态中捕捉织物的物理属性?
  • RQ2即使在仅使用视觉输入进行测试时,整合触觉数据是否仍能提升视觉材料识别任务的性能?
  • RQ3按压织物褶皱区域、多组触觉输入以及人工标注聚类等因素如何影响所学嵌入的质量?
  • RQ4对视觉输入进行数据增强在多大程度上提升了跨模态匹配中的泛化能力?
  • RQ5与单模态训练相比,视觉与触觉的联合训练是否能在新织物上的泛化性能上表现更优?

主要发现

  • 联合跨模态网络在深度图像匹配任务上优于单模态Siamese网络,在同一测试集上达到0.608的top-1精度,较后者提升显著。
  • 在新织物上的测试中,联合模型达到0.606的top-1精度,显著优于单模态SNN的0.554。
  • 对颜色图像进行数据增强后,深度图像到颜色图像匹配的top-1精度从0.4329提升至0.4674,表明鲁棒性得到改善。
  • 多输入网络(每种织物使用三张GelSight图像)实现了最精确的聚类,有效减少了对薄而硬的灯芯绒等相似织物的混淆。
  • 相较于平坦表面,对织物褶皱区域进行触觉采样可获得更优的嵌入表示,因其提供更丰富的机械反馈。
  • 人工标注的聚类有助于网络学习更具判别力的嵌入表示,尤其在区分厚度与刚性差异细微的织物时效果显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。