Skip to main content
QUICK REVIEW

[论文解读] Curious iLQR: Resolving Uncertainty in Model-based RL

Sarah Bechtle, Yixin Lin|arXiv (Cornell University)|Apr 15, 2019
Reinforcement Learning in Robotics参考文献 29被引用 16
一句话总结

本文提出了一种基于模型的强化学习框架——Curious iLQR,通过在轨迹优化中引入模型不确定性,以提升探索效率。该方法采用风险敏感的iLQR公式,同时最小化任务成本与预测方差,从而在仿真环境和真实机器人上加速7自由度机械臂的学习过程,相较于标准iLQR,实现了更快的收敛速度和更强的新任务泛化能力。

ABSTRACT

Curiosity as a means to explore during reinforcement learning problems has recently become very popular. However, very little progress has been made in utilizing curiosity for learning control. In this work, we propose a model-based reinforcement learning (MBRL) framework that combines Bayesian modeling of the system dynamics with curious iLQR, an iterative LQR approach that considers model uncertainty. During trajectory optimization the curious iLQR attempts to minimize both the task-dependent cost and the uncertainty in the dynamics model. We demonstrate the approach on reaching tasks with 7-DoF manipulators in simulation and on a real robot. Our experiments show that MBRL with curious iLQR reaches desired end-effector targets more reliably and with less system rollouts when learning a new task from scratch, and that the learned model generalizes better to new reaching tasks.

研究动机与目标

  • 通过在策略优化过程中主动减少动力学模型的不确定性,解决基于模型的强化学习中的模型偏差问题。
  • 在无需示范的情况下,实现在真实世界机器人平台上的样本高效且可泛化的策略学习。
  • 通过将好奇心驱动的探索融入轨迹优化,提升任务性能与模型泛化能力。
  • 在高维机器人系统(7自由度机械臂)上展示该方法的可扩展性与鲁棒性。

提出的方法

  • 该方法使用概率高斯过程模型来表示带有不确定性估计的机器人动力学。
  • 通过引入包含预测方差指数项的风险敏感成本函数,将迭代LQR(iLQR)扩展为风险敏感形式,优先选择能降低不确定性的动作。
  • 成本函数结合了任务特定成本与模型预测方差,鼓励探索状态-动作空间中不确定性较高的区域。
  • 算法在从收集的轨迹中学习动力学模型与通过Curious iLQR优化控制策略之间交替进行。
  • 通过风险敏感控制,将不确定性显式地纳入成本函数,实现对模型方差的直接优化。
  • 该框架通过迭代方式应用,每次轨迹 rollout 均能改进模型并优化策略,从而形成闭环学习过程。

实验结果

研究问题

  • RQ1在轨迹优化中整合模型不确定性是否能提升基于模型的强化学习的样本效率?
  • RQ2通过减少不确定性实现的好奇心驱动探索,是否能加快在新任务上的收敛速度?
  • RQ3与标准iLQR相比,使用Curious iLQR训练的模型在泛化到未见的抓取目标时是否表现更优?
  • RQ4该方法在无先验示范的真实世界7自由度机器人平台上表现如何?

主要发现

  • 在Sawyer机器人上,Curious iLQR平均仅需3.5次学习迭代即可达到目标,精度为7 cm,而标准iLQR则需5.9次迭代,精度为14 cm。
  • 在仿真环境中,Curious iLQR实现了0.26 m的平均抓取精度,显著优于标准iLQR的0.7 m。
  • 通过好奇心训练得到的模型在泛化到新未见目标时表现更优,精度高于未使用好奇心训练的模型。
  • 在仿真和硬件实验中,与标准iLQR相比,该方法将所需系统轨迹 rollout 数量减少了40%以上。
  • 探索信号随时间逐渐减小,表明机器人在模型不确定性被消除后,已从探索阶段平稳过渡到利用阶段。
  • 尽管存在测量噪声且控制频率较低(100 Hz),该方法在真实硬件上三次重复实验中均表现出鲁棒性与可重复性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。