Skip to main content
QUICK REVIEW

[论文解读] Self-Supervised Exploration via Disagreement

Deepak Pathak, Dhiraj Gandhi|arXiv (Cornell University)|Jun 10, 2019
Reinforcement Learning in Robotics参考文献 40被引用 17
一句话总结

该论文提出了一种自监督探索方法,通过最大化一组前向动态模型之间的分歧来驱动高效、样本高效的探索,且无需外部奖励。通过将探索建模为可微分优化问题,该方法实现了通过似然最大化直接进行策略学习,在随机环境中表现出鲁棒性能,并在少于1,000次交互下即可从零开始实现真实机器人对物体的交互。

ABSTRACT

Efficient exploration is a long-standing problem in sensorimotor learning. Major advances have been demonstrated in noise-free, non-stochastic domains such as video games and simulation. However, most of these formulations either get stuck in environments with stochastic dynamics or are too inefficient to be scalable to real robotics setups. In this paper, we propose a formulation for exploration inspired by the work in active learning literature. Specifically, we train an ensemble of dynamics models and incentivize the agent to explore such that the disagreement of those ensembles is maximized. This allows the agent to learn skills by exploring in a self-supervised manner without any external reward. Notably, we further leverage the disagreement objective to optimize the agent's policy in a differentiable manner, without using reinforcement learning, which results in a sample-efficient exploration. We demonstrate the efficacy of this formulation across a variety of benchmark environments including stochastic-Atari, Mujoco and Unity. Finally, we implement our differentiable exploration on a real robot which learns to interact with objects completely from scratch. Project videos and code are at https://pathak22.github.io/exploration-by-disagreement/

研究动机与目标

  • 解决传统内在奖励方法失效或样本效率低下的随机环境中高效探索的挑战。
  • 开发一种不依赖外部奖励或高方差强化学习估计器的自监督探索框架。
  • 通过将探索目标建模为可微函数,提升策略学习的样本效率。
  • 实现在7自由度机器人上从零开始进行真实世界部署的探索策略,以实现物体交互。

提出的方法

  • 训练一组前向动态模型,以从当前状态和动作输入预测下一状态转移。
  • 计算内在奖励为给定状态-动作对下,集成模型预测结果之间的方差(分歧)。
  • 将分歧目标作为可微信号,通过直接似然最大化优化策略,避免使用REINFORCE风格的策略梯度方法。
  • 使用共享编码器将状态编码到特征空间,以提高对观测和动作中随机性的鲁棒性。
  • 利用集成模型在随机动力学下收敛于均值的特性,避免在噪声环境中陷入停滞。
  • 将可微策略优化方法应用于真实机器人操作任务,使用RGB-D观测和实时交互反馈。

实验结果

研究问题

  • RQ1集成动态模型之间的分歧是否可在随机环境中作为有效、自监督的内在奖励用于探索?
  • RQ2基于模型分歧的可微策略优化是否比基于预测误差奖励的强化学习具有更高的样本效率?
  • RQ3该方法是否能实现真实机器人在无任何外部奖励塑造的情况下,从零开始学习物体交互技能?
  • RQ4在对随机动力学的鲁棒性和对未见物体的泛化能力方面,基于分歧的目标与基于好奇心的方法相比如何?

主要发现

  • 基于可微分歧的探索策略在真实世界设置中,仅用少于1,000次机器人交互就实现了物体交互,显著优于随机探索(17%)和基于REINFORCE的 curiosity 方法(1%)。
  • 在10种未见过的测试物体组成的保留测试集中,基于分歧的策略在约67%的动作中与物体发生交互,表现出强大的泛化能力和技能迁移能力。
  • 该方法成功避免了在随机环境中陷入停滞,因为当模型在随机动力学下收敛于均值时,集成分歧自然减小。
  • 通过似然最大化实现的可微策略优化相比高方差策略梯度方法(如REINFORCE)实现了更快、更稳定的训练。
  • 该方法在真实世界机器人操作任务中表现出可扩展性,包括在真实环境中对7自由度机械臂与多样化物体的交互。
  • 该方法在样本效率和鲁棒性方面均优于基于好奇心的探索方法,尤其在动作执行或观测噪声较高的环境中表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。