Skip to main content
QUICK REVIEW

[论文解读] ToolFlowNet: Robotic Manipulation with Tools via Predicting Tool Flow from Point Clouds

Daniel Seita, Yufei Wang|arXiv (Cornell University)|Nov 16, 2022
Robot Manipulation and Learning被引用 7
一句话总结

本文提出 ToolFlowNet,一种深度学习框架,通过点云观测预测密集的3D工具流,以实现对连续形变物体任务中工具的机器人操作。通过回归每个点的流矢量并将其转换为 SE(3) 变换,ToolFlowNet 在物理刮取实验中实现了 82% 的成功率,相比非流基线方法,通过改进空间和时间上的动作表征,表现更优。

ABSTRACT

Point clouds are a widely available and canonical data modality which convey the 3D geometry of a scene. Despite significant progress in classification and segmentation from point clouds, policy learning from such a modality remains challenging, and most prior works in imitation learning focus on learning policies from images or state information. In this paper, we propose a novel framework for learning policies from point clouds for robotic manipulation with tools. We use a novel neural network, ToolFlowNet, which predicts dense per-point flow on the tool that the robot controls, and then uses the flow to derive the transformation that the robot should execute. We apply this framework to imitation learning of challenging deformable object manipulation tasks with continuous movement of tools, including scooping and pouring, and demonstrate significantly improved performance over baselines which do not use flow. We perform 50 physical scooping experiments with ToolFlowNet and attain 82% scooping success. See https://tinyurl.com/toolflownet for supplementary material.

研究动机与目标

  • 为解决从原始 3D 点云观测中学习机器人操作策略的挑战,相较于图像或状态基方法,该问题仍研究不足。
  • 克服基于图像方法的局限性,如 2D 投影损失和 sim2real 差异,以及基于状态方法在形变物体状态估计方面的困难。
  • 引入一种新型动作表征,即在工具上使用密集的逐点流,以提升连续操作任务中策略的泛化能力。
  • 在仿真和真实机器人环境中,证明基于流的策略学习的有效性,尤其针对涉及液体等形变材料的任务。
  • 通过广泛的消融实验和在物理机器人(Sawyer)上的实际部署,验证该框架在刮取和倒液任务中的有效性。

提出的方法

  • ToolFlowNet 使用点云处理主干网络(例如基于 PointNet++ 的网络)预测工具上每个点的密集 3D 流矢量,表征从一个时间步到下一个时间步的预期运动。
  • 模型通过行为克隆进行训练,使用从演示轨迹中提取的真实流矢量作为监督信号,重点在于密集的逐点监督。
  • 预测的流矢量被聚合并转换为 SE(3) 变换(平移和旋转),以生成可执行的机器人动作。
  • 为处理低幅值动作导致的抖动运动,该方法采用可变组合技术,将真实动作组合直至每个组合后的流矢量幅度超过 1 cm。
  • 推理管道在远程 GPU 机器上运行,使用 Python 3 和 ZeroMQ(pyzmq)与机器人本地的 ROS 1 控制、仅含 CPU 的计算机通信。
  • 该框架兼容任何生成逐点输出的点云架构,并可无缝集成现有场景流估计技术。

实验结果

研究问题

  • RQ1从点云中预测密集的逐点流是否可作为机器人工具操作的有效动作表征?
  • RQ2与直接动作回归相比,基于点云衍生流的学习是否能提升策略在连续操作任务中的泛化能力和成功率?
  • RQ3基于流的策略是否能在涉及形变物体(如液体)的真实机器人任务中实现高成功率?
  • RQ4针对低幅值动作的可变组合技术对策略训练和真实世界性能有何影响?
  • RQ5与基于图像的模仿学习相比,ToolFlowNet 在多大程度上减少了 sim2real 差异?

主要发现

  • ToolFlowNet 在 50 次物理刮取实验中实现了 82% 的成功率,证明了其在真实世界中的强大泛化能力和鲁棒性。
  • 该模型在仿真和真实环境中的表现显著优于非流基线方法,尤其在需要连续运动的任务(如倒液和刮取)中表现更优。
  • 消融实验表明,与直接动作回归相比,密集的逐点流监督能带来更优的策略学习效果,尤其在复杂的 3D 操作场景中。
  • 可变组合技术成功缓解了低幅值动作带来的问题,实现了在真实机器人数据上的稳定且有效的策略训练。
  • 从测试实验中截取的子采样帧显示,成功实验的关键在于球体的精确定位以及将其稳定抬升至容器上方,而失败主要源于与容器壁的碰撞。
  • 项目官网的视频证据表明,碰撞失败较为常见,其根源在于工具轨迹对齐不良,凸显了基于流的空间控制的重要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。