[论文解读] Grasp and Motion Planning for Dexterous Manipulation for the Real Robot Challenge
本文提出了一种基于TriFinger机器人平台的灵巧操作抓取与运动规划框架,结合运动基元、基于RRT的抓取采样与路径规划以及反馈控制。该方法通过使用仿真训练的残差策略和鲁棒的PD控制,在真实机器人挑战赛的第二阶段和第三阶段中均获得第一名,展示了在观测噪声和故障恢复情况下的强大性能。
This report describes our winning submission to the Real Robot Challenge (https://real-robot-challenge.com/). The Real Robot Challenge is a three-phase dexterous manipulation competition that involves manipulating various rectangular objects with the TriFinger Platform. Our approach combines motion planning with several motion primitives to manipulate the object. For Phases 1 and 2, we additionally learn a residual policy in simulation that applies corrective actions on top of our controller. Our approach won first place in Phase 2 and Phase 3 of the competition. We were anonymously known as `ardentstork' on the competition leaderboard (https://real-robot-challenge.com/leader-board). Videos and our code can be found at https://github.com/ripl-ttic/real-robot-challenge.
研究动机与目标
- 解决在感知噪声和复杂位姿要求下对小型矩形物体进行灵巧操作的挑战。
- 开发一种鲁棒、实时的抓取与运动规划系统,能够处理如物体掉落等故障。
- 通过在仿真中学习残差策略来提升控制器性能,实现仿真到真实世界的迁移。
- 在多个难度逐步提升的阶段中,实现目标位姿的高精度与高速度达成。
- 在传感器噪声和机械不确定性存在的情况下,确保抓取与运动执行的稳定性和精确性。
提出的方法
- 采用抓取规划循环,对可行抓取进行采样,并利用RRT生成至目标位姿的无碰撞运动路径。
- 集成运动基元以实现物体对齐:预抓取定位、移动至中心位置以及姿态对齐,以降低规划复杂度。
- 使用PD控制跟踪规划的关节轨迹,在第一阶段和第二阶段引入力控制与残差策略反馈以提升抓取稳定性。
- 通过伪逆雅可比控制结合重力补偿与摩擦锥约束,从期望的力/力矩向量计算关节力矩。
- 在仿真中通过近端策略优化(PPO)训练残差策略,初始动作分布为零均值、低方差,以稳定学习过程。
- 设计包含目标距离、力矩/速度正则化项以及滑移惩罚项的奖励函数,以鼓励牢固抓取与平滑运动。
实验结果
研究问题
- RQ1在物体位姿估计存在噪声的情况下,机器人如何鲁棒地规划灵巧操作的抓取与运动?
- RQ2在仿真中学习的残差策略在多大程度上能提升基础运动控制器的性能,并泛化到真实世界执行?
- RQ3运动基元在简化复杂操作任务规划问题中起到何种作用?
- RQ4在运动过程中,PD控制结合力控制与残差策略反馈在维持抓取稳定性方面有多有效?
- RQ5经过仿真训练的策略是否能在不使用领域随机化或真实数据微调的情况下,有效迁移到真实机器人上?
主要发现
- 该系统在第二阶段(真实机器人立方体操作)和第三阶段(小型长方体操作)中均获得第一名,展现出高性能与强鲁棒性。
- 在仿真中学习的残差策略显著提升了真实机器人上的控制器性能,即使未使用领域随机化或真实数据微调。
- 在第一阶段和第二阶段中,力控制与残差策略反馈有效减少了抓取不稳定性,提升了成功率,此时位姿估计准确。
- 在第三阶段中,由于位姿估计存在噪声,仅使用PD控制(无反馈)已足够且鲁棒,能够在观测误差存在的情况下实现可靠执行。
- 该方法成功实现了故障恢复(如物体掉落),并以高一致性执行了复杂的多步操作序列。
- 规划延迟以及RRT执行期间的高负奖励被识别为关键性能瓶颈,提示采用基于PRM的预计算可提升速度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。