Skip to main content
QUICK REVIEW

[论文解读] Connecting Touch and Vision via Cross-Modal Prediction

Yunzhu Li, Jun-Yan Zhu|arXiv (Cornell University)|Jun 14, 2019
Tactile and Sensory Interactions参考文献 50被引用 10
一句话总结

本文提出了一种跨模态预测框架,通过使用带有尺度和位置条件的条件对抗网络,学习从视觉输入生成逼真的触觉信号,反之亦然。主要贡献是一种自监督方法,在触觉到视觉和视觉到触觉任务上实现了与完全监督基线相当的性能,通过大规模机器人采集的300万组视觉-触觉配对数据集上的真人感知研究和定量指标进行了验证。

ABSTRACT

Humans perceive the world using multi-modal sensory inputs such as vision, audition, and touch. In this work, we investigate the cross-modal connection between vision and touch. The main challenge in this cross-domain modeling task lies in the significant scale discrepancy between the two: while our eyes perceive an entire visual scene at once, humans can only feel a small region of an object at any given moment. To connect vision and touch, we introduce new tasks of synthesizing plausible tactile signals from visual inputs as well as imagining how we interact with objects given tactile data as input. To accomplish our goals, we first equip robots with both visual and tactile sensors and collect a large-scale dataset of corresponding vision and tactile image sequences. To close the scale gap, we present a new conditional adversarial model that incorporates the scale and location information of the touch. Human perceptual studies demonstrate that our model can produce realistic visual images from tactile data and vice versa. Finally, we present both qualitative and quantitative experimental results regarding different system designs, as well as visualizing the learned representations of our model.

研究动机与目标

  • 弥合视觉(全场景感知)与触觉(局部传感)在跨模态学习中的显著尺度差距。
  • 实现零样本跨模态生成:在无显式人工标注的情况下,从视觉预测触觉,或从触觉预测视觉。
  • 开发一种鲁棒的生成模型,即使在高频、低多样性触觉数据下也能避免生成对抗网络训练中的模式崩溃。
  • 通过真人研究和定量指标验证生成结果的真实性和感知合理性。
  • 可视化并解释模型在视觉与触觉模态间学习到的共享表征。

提出的方法

  • 配备GelSight触觉传感器和网络摄像头的机器人系统,在195种物体上执行了12,000次触觉交互,生成了300万组配对的视觉-触觉图像序列。
  • 设计了一种条件对抗网络,通过显式引入触觉的尺度和空间位置进行条件控制,以解决模态间的尺度差异问题。
  • 采用数据重平衡策略以缓解生成对抗网络训练中的模式崩溃,该问题通常由平坦、无纹理的触觉区域占主导而引发。
  • 模型在两个任务上进行训练:(1) 视觉到触觉预测(从视觉输入生成合理的触觉信号),(2) 触觉到视觉预测(从触觉输入生成视觉场景)。
  • 通过Amazon Mechanical Turk研究进行感知评估,人类参与者判断生成的触觉位置是否与真实值相似,或生成的图像是否为真实图像。
  • 使用特征可视化技术解释模型的内部表征,揭示其对边缘和表面特性等几何线索的敏感性。

实验结果

研究问题

  • RQ1在视觉与触觉之间存在显著空间尺度差距的情况下,自监督模型能否从视觉输入生成逼真的触觉信号?
  • RQ2模型能否仅从触觉输入生成合理的视觉场景,且性能与监督方法相当?
  • RQ3对触觉位置和尺度的条件控制在视觉-触觉预测中的跨模态生成质量方面有何提升作用?
  • RQ4该模型在零样本跨模态生成中对未见物体的泛化能力如何?
  • RQ5模型学习到了何种共享物理表征,从而实现准确的跨模态迁移?

主要发现

  • 在真人感知研究中,该方法在已见物体上的‘感觉相似’触觉定位任务中达到89.20%的准确率,在未见物体上达到83.44%,显著优于pix2pix及其时序变体等基线模型。
  • 在区分生成图像与真实图像的测试中,该模型在已见物体上的欺骗率(fooling rate)达到30.50%,在未见物体上为24.22%,表明其具有较强的感知真实性,尽管pix2pix因模式崩溃导致原始得分更高。
  • 自监督方法的性能与使用1,000个人工标注触觉位置训练的完全监督基线相当,证明了该任务中自监督学习的有效性。
  • 通过数据重平衡策略,该模型成功避免了模式崩溃,而标准GAN在低多样性触觉输入下常重复生成相同输出。
  • 对学习表征的可视化显示,模型能够学习编码边缘和表面特征等几何线索,这些线索对跨模态对齐至关重要。
  • 时序建模在视觉到触觉预测中提升了性能,但并未一致改善触觉到视觉的结果,可能是因为数据集中仅包含物体接触的配对样本。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。