Skip to main content
QUICK REVIEW

[论文解读] DoorGym: A Scalable Door Opening Environment And Baseline Agent

Yusuke Urakami, Alec Hodgkinson|arXiv (Cornell University)|Aug 5, 2019
Reinforcement Learning in Robotics参考文献 28被引用 21
一句话总结

本文介绍了DoorGym,一个用于通过强化学习训练鲁棒开门策略的开源、领域随机化仿真环境。通过随机化门和机器人代理的视觉与物理属性,该框架使策略能够泛化至多种门类型和现实世界条件,在仿真中实现高达95%的成功率,并成功实现使用PPO和SAC基线的零样本迁移至真实世界环境。

ABSTRACT

In order to practically implement the door opening task, a policy ought to be robust to a wide distribution of door types and environment settings. Reinforcement Learning (RL) with Domain Randomization (DR) is a promising technique to enforce policy generalization, however, there are only a few accessible training environments that are inherently designed to train agents in domain randomized environments. We introduce DoorGym, an open-source door opening simulation framework designed to utilize domain randomization to train a stable policy. We intend for our environment to lie at the intersection of domain transfer, practical tasks, and realism. We also provide baseline Proximal Policy Optimization and Soft Actor-Critic implementations, which achieves success rates between 0% up to 95% for opening various types of doors in this environment. Moreover, the real-world transfer experiment shows the trained policy is able to work in the real world. Environment kit available here: https://github.com/PSVL/DoorGym/

研究动机与目标

  • 解决在多种门类型和环境条件下训练可泛化开门策略的挑战。
  • 通过在实际、真实的机器人操作任务中应用领域随机化,弥合仿真与真实世界部署之间的现实差距。
  • 提供一个可扩展的开源仿真框架,支持多种机器人配置和门把手类型。
  • 建立一个基准环境及基线智能体,以实现机器人操作研究的可重现性。
  • 展示从仿真到真实世界开门任务的零样本策略迁移。

提出的方法

  • 作者使用MuJoCo进行物理仿真、Unity进行逼真渲染,开发了与Gym兼容的DoorGym仿真环境。
  • 对关键参数实施领域随机化,包括门把手类型(圆形、杆式、拉手)、视觉纹理、光照条件,以及摩擦力和质量等物理属性。
  • 该环境支持多种机器人配置:挂钩夹持器、悬浮夹持器,以及具有不同自由度的移动操作臂。
  • 采用近端策略优化(PPO)和软演员评论家(SAC)作为基线强化学习算法,并对超参数进行调优以提升泛化能力。
  • 通过自定义的MuJoCo-Unity插件,支持通过Python API访问高保真视觉观测和逼真渲染。
  • 训练流程包括对门和代理配置的随机采样,并基于向开门目标的进展进行奖励塑造。

实验结果

研究问题

  • RQ1在领域随机化仿真中训练的单一强化学习策略,能否在广泛分布的门类型和环境变化中实现泛化?
  • RQ2领域随机化在多大程度上提升了从仿真到真实世界开门任务的零样本迁移性能?
  • RQ3不同机器人配置(如固定臂与移动臂)如何影响策略泛化能力和成功率?
  • RQ4在领域分布偏移存在的情况下,视觉观测质量(如RGB与噪声视觉)对策略性能有何影响?
  • RQ5在这一复杂、高维控制任务中,PPO与SAC在样本效率和鲁棒性方面如何比较?

主要发现

  • PPO基线在领域随机化条件下实现了高达95%的成功率,对拉手型门把手表现最佳,尤其在使用挂钩或夹持器机械臂时。
  • SAC基线展现出强大的泛化能力,在使用挂钩机器人时对拉手型门把手的成功率达到62%,使用夹持器时为58%,即使在视觉噪声和随机化条件下仍表现稳定。
  • 真实世界迁移实验表明,DoorGym中训练的策略无需进一步微调即可成功打开真实门,证实了零样本部署能力。
  • 基于视觉的策略在性能上显著劣于基于真实状态的策略,尤其在杆式和圆形门把手任务中,凸显了视觉泛化的挑战。
  • 当仅使用视觉观测时,杆式和圆形门把手的成功率显著下降,表明视觉感知仍是主要瓶颈。
  • 移动机器人配置在推拉门任务中成功率更高(最高达100%),相较于固定臂表现更优,表明移动性增强了任务鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。