[论文解读] Learning Fine Pinch-Grasp Skills using Tactile Sensing from A Few Real-world Demonstrations
本文提出了一种数据高效的从演示学习(LfD)框架,利用高维触觉传感和本体感觉反馈,仅通过一次真实世界的人类示范即可学习精细灵巧的捏握技能。通过使用卷积自编码器提取触觉特征,并将这些特征与行为克隆网络中的本体感觉状态融合,该方法实现了对未见过物体的鲁棒、接触感知的抓握与再抓握,即使在受到大外部扰动的情况下也能保持稳定,展示了具备丰富触觉反馈的一次性技能迁移能力。
Imitation learning for robot dexterous manipulation, especially with a real robot setup, typically requires a large number of demonstrations. In this paper, we present a data-efficient learning from demonstration framework which exploits the use of rich tactile sensing data and achieves fine bimanual pinch grasping. Specifically, we employ a convolutional autoencoder network that can effectively extract and encode high-dimensional tactile information. Further, We develop a framework that achieves efficient multi-sensor fusion for imitation learning, allowing the robot to learn contact-aware sensorimotor skills from demonstrations. Our comparision study against the framework without using encoded tactile features highlighted the effectiveness of incorporating rich contact information, which enabled dexterous bimanual grasping with active contact searching. Extensive experiments demonstrated the robustness of the fine pinch grasp policy directly learned from few-shot demonstration, including grasping of the same object with different initial poses, generalizing to ten unseen new objects, robust and firm grasping against external pushes, as well as contact-aware and reactive re-grasping in case of dropping objects under very large perturbations. Furthermore, the saliency map analysis method is used to describe weight distribution across various modalities during pinch grasping, confirming the effectiveness of our framework at leveraging multimodal information.
研究动机与目标
- 开发一种数据高效的LfD框架,利用真实机器人示范中的丰富触觉反馈,实现灵巧的双臂操作。
- 通过整合高维触觉数据与本体感觉状态信息,解决仅凭一次示范学习精细运动技能的挑战。
- 通过利用柔性触觉传感器的判别能力,克服仅依赖视觉或低维传感器反馈在一次性学习中的局限性。
- 实现在外部扰动下鲁棒的抓握与自主再抓握,该行为自然地从学习到的感知-运动策略中涌现。
- 通过显著性图分析模态贡献,揭示在抓握执行不同阶段中触觉与本体感觉反馈的加权方式。
提出的方法
- 使用卷积自编码器从柔性TacTip传感器中提取并压缩高维触觉图像,生成低维潜在空间表征。
- 将学习到的触觉特征与本体感觉状态特征(关节角度、末端执行器位置)融合,形成多模态状态表征。
- 训练行为克隆网络,将单次人类示范中的融合状态-动作对映射到可复现示范运动技能的策略。
- 将触觉图像差异(接触模式的变化)作为额外输入模态,以增强对动态接触变化的敏感性。
- 应用显著性图分析,计算不同抓握阶段中触觉与本体感觉模态的相对贡献权重。
- 端到端地在真实机器人数据上训练策略,避免使用仿真环境,无需领域随机化或大规模数据,即可直接部署到硬件上。

实验结果
研究问题
- RQ1机器人能否仅通过触觉与本体感觉反馈,从一次真实世界示范中学习精细灵巧的捏握技能?
- RQ2在抓握的不同阶段(预抓握、按压、滚动提升、稳定阶段),触觉与本体感觉模态在贡献上存在何种差异?
- RQ3与仅依赖本体感觉相比,触觉传感在多大程度上提升了单次学习的性能?
- RQ4所学策略能否泛化到具有不同直径、质量与材质的未见过物体?
- RQ5该策略能否自主检测并从大外部扰动(如物体掉落或被推)中恢复?
主要发现
- 该框架成功地仅通过一次真实世界示范和触觉与本体感觉反馈,学习到了稳定且鲁棒的精细捏握策略。
- 该策略泛化到了十种未见过的物体,其直径、质量与材质各不相同,展示了在同一物体类别内的强大零样本泛化能力。
- 即使在受到大外部推力的情况下,该策略仍能保持牢固且稳定的抓握,表现出对动态扰动的强适应能力。
- 在物体掉落之后,系统能自主执行成功的再抓握,该行为虽未在示范中明确展示,但自然地从学习到的感知-运动策略中涌现。
- 显著性图分析表明,在接触阶段(按压与提升阶段),触觉反馈占据主导地位;而在预抓握与稳定阶段,本体感觉在协调中发挥关键作用。
- 对比实验确认,触觉传感对于单次学习灵巧技能至关重要,因为缺乏触觉输入的基线方法无法有效学习该任务。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。