Skip to main content
QUICK REVIEW

[论文解读] Multimodel Sensor Fusion for Learning Rich Models for Interacting Soft Robots

Thomas George Thuruthel, Fumiya Iida|arXiv (Cornell University)|May 9, 2022
Advanced Sensor and Energy Harvesting Materials被引用 5
一句话总结

本文提出了一种端到端的深度学习框架,通过融合传出(动作)和传入(触觉)传感器数据,学习软体机器人的高维视觉模型,从而实现对身体形状和环境交互的精确预测。该方法实现了自发的自体-环境分割,并在无需人工标注或中间处理的情况下,实现了自建模和物体操作技能。

ABSTRACT

Soft robots are typically approximated as low-dimensional systems, especially when learning-based methods are used. This leads to models that are limited in their capability to predict the large number of deformation modes and interactions that a soft robot can have. In this work, we present a deep-learning methodology to learn high-dimensional visual models of a soft robot combining multimodal sensorimotor information. The models are learned in an end-to-end fashion, thereby requiring no intermediate sensor processing or grounding of data. The capabilities and advantages of such a modelling approach are shown on a soft anthropomorphic finger with embedded soft sensors. We also show that how such an approach can be extended to develop higher level cognitive functions like identification of the self and the external environment and acquiring object manipulation skills. This work is a step towards the integration of soft robotics and developmental robotics architectures to create the next generation of intelligent soft robots.

研究动机与目标

  • 解决低维模型在捕捉高自由度软体机器人完整形变和交互动力学方面的局限性。
  • 开发一种数据驱动的端到端学习方法,绕过对原始传感器数据的中间处理或人工标注。
  • 整合触觉和视觉感官输入,构建软体机器人在与环境交互过程中状态的丰富内部模型。
  • 通过无监督学习传感器运动表征,实现自体识别和物体操作等自发认知功能。
  • 证明此类模型在形状控制、遮挡处理以及未来预测控制中应用的可行性。

提出的方法

  • 训练一个深度神经网络,仅使用命令动作和实时触觉传感器读数作为输入,预测软体人形手指的未来视觉状态。
  • 采用静态(非循环)卷积神经网络架构,将多模态传感器运动输入映射到预测图像帧,避免因序列压缩导致的信息损失。
  • 利用原始、未经处理的视觉和触觉数据,实现无需真实标签或人工特征工程的自监督学习。
  • 采用双流编码器-解码器结构,使网络能够从传感器运动输入重建视觉状态,潜在空间捕捉自体与环境之间的结构差异。
  • 利用转置卷积层可视化并分析学习到的表征,揭示机器人本体与外部物体之间自发的分割。
  • 使用包含软手指与可操作物体(如笔)接触的交互数据集,以端到端方式训练模型。

实验结果

研究问题

  • RQ1深度学习模型能否仅使用传出动作指令和传入触觉反馈,预测软体机器人的高维视觉状态?
  • RQ2触觉与视觉数据的融合在软体机器人与环境交互过程中,如何提升内部状态建模的准确性和鲁棒性?
  • RQ3在无显式监督的情况下,机器人本体与外部物体之间的自发分割能否从传感器运动数据中自然产生?
  • RQ4触觉传感器在实现动态交互过程中对准确自建模和本体形状感知方面发挥何种作用?
  • RQ5此类模型在多大程度上能够支持软体机器人系统中的高级认知功能,如物体操作和自我意识?

主要发现

  • 静态网络架构在时间序列预测任务中优于循环架构,可能是因为减少了因特征压缩和传感器滞回导致的信息损失。
  • 触觉传感器数据在交互过程中对准确预测机器人身体图式至关重要,尤其是在外部力导致机器人形状改变时。
  • 该模型成功基于动作和触觉输入预测了环境变化,如物体位移,表明其具备建模外部动态的能力。
  • 潜在空间可视化揭示了软体机器人本体与外部物体(如笔)之间清晰的自发分割,表明实现了无监督的自体-环境区分。
  • 即使在遮挡情况下,该模型仍能实现准确的视觉状态预测,表明其在复杂或杂乱环境中可能作为视觉传感器的替代方案。
  • 学习到的模型通过无监督传感器运动学习,实现了自识别和物体操作技能等认知功能的自发涌现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。