[论文解读] Transferring Dexterous Manipulation from GPU Simulation to a Remote Real-World TriFinger
本文提出了一种统一的深度强化学习策略,用于在TriFinger机器人上实现6-DoF的灵巧抓握操作,该策略在GPU加速的仿真环境中通过领域随机化以及基于关键点的观测与奖励进行训练。该方法在远程真实世界的TriFinger机器人上实现了83%的仿真到现实的迁移成功率,能够泛化到未见过的物体,并通过单一策略实现稳健的抓取、释放和重新定位。
We present a system for learning a challenging dexterous manipulation task involving moving a cube to an arbitrary 6-DoF pose with only 3-fingers trained with NVIDIA's IsaacGym simulator. We show empirical benefits, both in simulation and sim-to-real transfer, of using keypoints as opposed to position+quaternion representations for the object pose in 6-DoF for policy observations and in reward calculation to train a model-free reinforcement learning agent. By utilizing domain randomization strategies along with the keypoint representation of the pose of the manipulated object, we achieve a high success rate of 83% on a remote TriFinger system maintained by the organizers of the Real Robot Challenge. With the aim of assisting further research in learning in-hand manipulation, we make the codebase of our system, along with trained checkpoints that come with billions of steps of experience available, at https://s2r2-ig.github.io
研究动机与目标
- 开发一种鲁棒的、统一的强化学习策略,用于在真实机器人手上完成涉及任意6-DoF物体重新定位的复杂抓握操作任务。
- 通过领域随机化和高保真仿真,解决灵巧操作中仿真到现实的迁移挑战。
- 通过可扩展的训练和基于关键点的表征,提升策略在未见物体和物理参数变化下的泛化能力。
- 实现在无需物理访问条件下的远程云化机器人系统部署,证明在全队列部署中的鲁棒性。
- 提供可复现的、开源的框架及预训练检查点,以加速未来在仿真到现实灵巧操作领域的研究。
提出的方法
- 在高速GPU加速的MuJoCo仿真环境中训练了一个无模型的深度强化学习智能体,采用领域随机化以提升仿真到现实的鲁棒性。
- 在策略观测和密集奖励函数中均使用基于关键点的物体位姿表征,以提升6-DoF操作中学习效率和泛化能力。
- 通过数十亿次环境交互的大规模训练,学习到一个能够执行抓取、释放和重新定位的统一策略。
- 通过基于云的TriFinger机器人集群实现远程机器人闭环训练流程,无需物理访问即可验证真实世界性能。
- 对新物体形状和尺寸进行微调,以提升零样本泛化能力,尤其针对尺度变化。
- 推理阶段使用现成的位姿估计方法(如基于YOLO的检测器),以实现最小化微调的现实世界部署。

实验结果
研究问题
- RQ1单一深度强化学习策略是否能够成功在仿真中学习完成完整的6-DoF灵巧抓握操作(包括抓取和重新定位),并稳健地迁移到真实世界?
- RQ2在观测和奖励中使用基于关键点的物体位姿表征,与传统的位置+四元数表征相比,在仿真到现实的成功率和训练稳定性方面有何差异?
- RQ3在不进行微调的情况下,单一策略对未见物体形态和尺度的泛化能力达到何种程度?
- RQ4领域随机化在远程、基于云的机器人平台上实现高仿真到现实迁移性能方面有多有效?
- RQ5在真实世界部署中,该策略是否能够自主恢复失败情况(如物体掉落)并重新抓取物体?
主要发现
- 采用基于关键点的观测与奖励的策略(O-KP+R-KP)在真实TriFinger机器人上实现了82.5%的成功率,优于所有消融实验。
- 使用基于关键点奖励的策略显著提升了成功率(分别为77.5%和82.5%),而使用位置+四元数奖励的策略成功率仅为55%和60%。
- 对未见过的不同尺寸长方体实现零样本泛化,成功率为46.8%,经微调后提升至72.9%,表明尺度比形状对泛化的影响更为关键。
- 策略展现出涌现行为,如‘掉落并重新抓取’,以提升位姿精度和稳定性,尤其在具有挑战性的目标位置表现显著。
- 系统成功实现了从仿真到远程真实TriFinger机器人的迁移,且无需物理访问,验证了在全队列、基于云的部署场景下的鲁棒性。
- 在EGAD基准上,对未见物体进行微调后,成功率从84.9%(零样本)提升至87.2%,证实了微调在缓解域偏移方面的有效性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。