[论文解读] Goal-Auxiliary Actor-Critic for 6D Robotic Grasping with Point Clouds
本文提出目标辅助DDPG(GA-DDPG),一种结合模仿学习与目标预测辅助训练的强化学习方法,用于从自指点云中学习闭环6D机器人抓取策略。该策略直接输出连续的6D夹爪位姿动作,在真实世界的人机交接任务中实现了78%的成功率,并在桌面和动态场景下对未见物体表现出更好的泛化能力。
6D robotic grasping beyond top-down bin-picking scenarios is a challenging task. Previous solutions based on 6D grasp synthesis with robot motion planning usually operate in an open-loop setting, which are sensitive to grasp synthesis errors. In this work, we propose a new method for learning closed-loop control policies for 6D grasping. Our policy takes a segmented point cloud of an object from an egocentric camera as input, and outputs continuous 6D control actions of the robot gripper for grasping the object. We combine imitation learning and reinforcement learning and introduce a goal-auxiliary actor-critic algorithm for policy learning. We demonstrate that our learned policy can be integrated into a tabletop 6D grasping system and a human-robot handover system to improve the grasping performance of unseen objects. Our videos and code can be found at https://sites.google.com/view/gaddpg .
研究动机与目标
- 解决依赖预合成抓取位姿且对误差敏感的开环6D抓取方法的局限性。
- 仅使用来自自指摄像头的点云观测,端到端学习闭环控制策略以实现6D抓取。
- 通过在深度强化学习框架中结合模仿学习与目标辅助训练,提升样本效率和策略泛化能力。
- 通过事后目标监督实现对未知物体的微调,支持在真实世界环境中持续学习。
提出的方法
- 该方法基于深度确定性策略梯度(DDPG)构建目标辅助演员-评论家框架,训练演员和评论家将最终6D抓取位姿作为辅助任务进行预测。
- 通过在模拟环境中使用ShapeNet物体的运动与抓取联合规划器生成示范,实现大规模且一致的专家轨迹。
- 利用这些示范的离线数据进行策略训练,其中目标预测任务由已知物体的专家规划进行监督,而未知物体则通过成功轨迹中的事后目标进行监督。
- 状态表示为经过分割的目标物体点云,通过基于PointNet的编码器提取3D特征,作为策略输入。
- 动作空间定义为机器人夹爪的相对6D位姿变换(3D平移和3D旋转),实现在6D空间中的连续控制。
- 通过基于点云的感知和端到端策略学习,支持从仿真到真实世界的迁移,降低对精确3D物体模型的依赖。
实验结果
研究问题
- RQ1能否通过结合模仿学习与强化学习,从点云观测中有效学习闭环6D抓取策略?
- RQ2将目标预测作为辅助任务,如何提升6D抓取策略的样本效率与性能?
- RQ3在未见物体上,尤其是在使用事后目标监督的情况下,策略是否能实现对无先验3D模型物体的泛化?
- RQ4在动态场景(如移动物体的人机交接)中,该策略的有效性如何?
- RQ5与传统开环抓取合成方法相比,该方法在多大程度上减少了仿真到真实世界的差距?
主要发现
- 所提出的GA-DDPG方法在10种未见过的家用物体上的人机交接任务中实现了78%的成功率,展现出强大的泛化能力。
- 该策略在桌面6D抓取系统中显著提升了抓取性能,并成功泛化到训练期间未见过的物体。
- 目标辅助训练的整合显著增强了策略学习,使得利用事后目标对未知物体进行有效微调成为可能。
- 用户研究证实,参与者认为机器人动作流畅、适应性强且安全,对机器人对物体运动的响应能力高度认可。
- 系统在动态环境中表现出鲁棒性,尽管在反应式交接场景中性能略有下降,原因包括15fps的摄像头延迟和远距离下的传感噪声。
- 该方法在马克杯和钢笔等复杂物体上的表现优于或匹配了特定任务的人机交接系统,表明其对多样化物体形状的强大适应能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。