Skip to main content
QUICK REVIEW

[论文解读] Recovery RL: Safe Reinforcement Learning with Learned Recovery Zones

Brijen Thananjeyan, Ashwin Balakrishna|arXiv (Cornell University)|Oct 29, 2020
Reinforcement Learning in Robotics参考文献 35被引用 20
一句话总结

Recovery RL 提出了一种双策略框架,通过在离线数据上预训练恢复策略来避免约束违规,从而将任务学习与安全执行解耦。该方法在仿真环境中比以往方法实现 2–20 倍更好的任务成功率与约束违规之间的权衡,在真实机器人实验中实现 3 倍的改进。

ABSTRACT

Safety remains a central obstacle preventing widespread use of RL in the real world: learning new tasks in uncertain environments requires extensive exploration, but safety requires limiting exploration. We propose Recovery RL, an algorithm which navigates this tradeoff by (1) leveraging offline data to learn about constraint violating zones before policy learning and (2) separating the goals of improving task performance and constraint satisfaction across two policies: a task policy that only optimizes the task reward and a recovery policy that guides the agent to safety when constraint violation is likely. We evaluate Recovery RL on 6 simulation domains, including two contact-rich manipulation tasks and an image-based navigation task, and an image-based obstacle avoidance task on a physical robot. We compare Recovery RL to 5 prior safe RL methods which jointly optimize for task performance and safety via constrained optimization or reward shaping and find that Recovery RL outperforms the next best prior method across all domains. Results suggest that Recovery RL trades off constraint violations and task successes 2 - 20 times more efficiently in simulation domains and 3 times more efficiently in physical experiments. See https://tinyurl.com/rl-recovery for videos and supplementary material.

研究动机与目标

  • 解决真实世界强化学习中安全探索的挑战,其中广泛探索可能导致机器人或环境受损。
  • 克服学习过程中最大化任务性能与最小化不安全行为之间的冲突。
  • 通过利用离线数据预学习危险状态和恢复动作,减少训练期间对在线约束违规的依赖。
  • 将任务策略优化与安全约束解耦,避免因联合优化导致的次优策略。
  • 在高维观测空间(如图像)中实现高效、安全的策略学习,适用于真实机器人系统。

提出的方法

  • 使用两种不同的策略:仅优化任务奖励的任务策略,以及在可能发生约束违规时激活的恢复策略。
  • 使用从人类示范或先前不安全经验中收集的离线数据,预训练恢复策略和风险感知 Q 函数。
  • 基于离线数据和风险估计,将恢复集定义为马尔可夫决策过程中未来发生约束违规可能性较高的区域。
  • 通过动作重标注训练任务策略,使其与实际结果相关联,从而提高样本效率和成功率。
  • 使用风险感知 Q 函数估计未来约束违规的概率,并在风险超过阈值时触发恢复策略。
  • 允许在保留离线预训练建立的安全保证的前提下,对两种策略进行在线微调。

实验结果

研究问题

  • RQ1在不依赖在线约束违规的前提下,恢复策略的离线预训练是否能提升强化学习的安全性和样本效率?
  • RQ2将任务优化与安全执行解耦,对所学策略的性能和鲁棒性有何影响?
  • RQ3Recovery RL 在平衡任务成功率与约束违规方面,相较于联合优化方法的优越程度如何?
  • RQ4Recovery RL 对用于预训练恢复策略的离线数据量的敏感程度如何?
  • RQ5Recovery RL 是否能泛化到高维视觉观测和真实世界机器人控制任务?

主要发现

  • 在六个仿真环境中,Recovery RL 在五种最先进的安全强化学习方法中表现更优,实现任务成功率与约束违规之间 2–20 倍更好的权衡。
  • 在基于图像的障碍物避让任务的真实机器人实验中,Recovery RL 相较于次优基线方法将约束违规减少了 3 倍。
  • 当省略恢复策略和风险函数的离线预训练时,性能显著下降,凸显了离线数据的重要性。
  • 即使仅有 1,000 条离线转移数据,Recovery RL 也能实现良好性能,仅当数据低于此阈值时性能才明显下降。
  • 在任务策略训练期间进行动作重标注至关重要——若省略,任务成功率会急剧下降。
  • 与先前方法相比,Recovery RL 对超参数调优的敏感性更低,尤其在风险阈值和风险系数方面。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。