Skip to main content
QUICK REVIEW

[论文解读] Path Integral Guided Policy Search

Yevgen Chebotar, Mrinal Kalakrishnan|arXiv (Cornell University)|Oct 3, 2016
Reinforcement Learning in Robotics参考文献 34被引用 12
一句话总结

本文提出路径积分引导策略搜索(PI-GPS),一种将引导策略搜索中传统的基于LQR的局部策略优化器替换为PI²——一种无模型、随机最优控制算法——的方法,从而实现对具有不连续接触动力学的复杂机器人操作策略的有效学习。通过在训练过程中持续使用策略内采样以多样化训练实例,该方法实现了更优的泛化性能,并在基于视觉的深度神经网络策略下,在门开启和抓取放置任务中优于先前的方法。

ABSTRACT

We present a policy search method for learning complex feedback control policies that map from high-dimensional sensory inputs to motor torques, for manipulation tasks with discontinuous contact dynamics. We build on a prior technique called guided policy search (GPS), which iteratively optimizes a set of local policies for specific instances of a task, and uses these to train a complex, high-dimensional global policy that generalizes across task instances. We extend GPS in the following ways: (1) we propose the use of a model-free local optimizer based on path integral stochastic optimal control (PI2), which enables us to learn local policies for tasks with highly discontinuous contact dynamics; and (2) we enable GPS to train on a new set of task instances in every iteration by using on-policy sampling: this increases the diversity of the instances that the policy is trained on, and is crucial for achieving good generalization. We show that these contributions enable us to learn deep neural network policies that can directly perform torque control from visual input. We validate the method on a challenging door opening task and a pick-and-place task, and we demonstrate that our approach substantially outperforms the prior LQR-based local policy optimizer on these tasks. Furthermore, we show that on-policy sampling significantly increases the generalization ability of these policies.

研究动机与目标

  • 为解决基于模型的 LQR 方法在具有不连续接触动力学的任务(如门开启和抓取放置)中表现不佳的问题。
  • 通过可扩展的监督学习框架,实现对高维、深度神经网络策略在基于视觉的机器人操作中的有效训练。
  • 通过在每次迭代中使用策略内采样动态采样新任务实例,提升训练多样性,从而改善策略泛化能力。
  • 证明无模型的 PI² 能够在高度非光滑、不连续的环境中有效优化局部策略,而 LQR 方法则会失效。
  • 在需要复杂接触处理和视觉输入处理的真实机器人任务上验证该方法。

提出的方法

  • 用 PI² 替代引导策略搜索中的基于 LQR 的局部策略优化器,PI² 是一种无模型的随机最优控制方法,通过路径积分近似实现策略改进。
  • 提出一种 KL 约束的 PI² 变体,以在保持探索和收敛性的同时确保稳定的局部策略更新。
  • 在全局策略训练阶段采用策略内采样,即在每次迭代中从当前全局策略的行为中采样新任务实例。
  • 使用深度神经网络策略,将高维视觉观测直接映射到电机扭矩,通过在局部策略生成的轨迹上进行监督学习进行训练。
  • 通过课程学习策略,逐步扩大训练区域,以维持最低成功率并避免灾难性遗忘。
  • 仅在初始阶段使用示范数据确定策略结构,随后通过迭代式策略内采样使全局策略在广泛的任务实例分布上实现泛化。

实验结果

研究问题

  • RQ1PI² 是否能有效优化在 LQR 方法失效的、具有高度不连续接触动力学的机器人操作任务中的局部策略?
  • RQ2在引导策略搜索中使用策略内采样是否能显著提升全局策略在多样化任务实例上的泛化能力?
  • RQ3通过在 PI² 优化的局部策略生成的轨迹上进行监督学习训练的深度神经网络策略,是否能在真实世界基于视觉的操纵任务中实现高性能?
  • RQ4PI² 与策略内采样结合的方法在复杂任务上的成功率和鲁棒性方面,与使用 LQR 的先前 GPS 方法相比如何?
  • RQ5当通过迭代式、多样化的实例采样进行训练时,全局策略在初始示范区域之外的泛化能力在多大程度上得以扩展?

主要发现

  • 基于 PI² 的局部策略优化在门开启和抓取放置任务中显著优于先前的基于 LQR 的方法,使在具有不连续动力学的环境中成功学习成为可能。
  • 策略内采样显著增加了各次迭代中训练实例的多样性,使抓取放置任务的成功率从初始的 40% 提升至全训练后的 86.7%,提升幅度达 46.7%。
  • 最终策略在初始示范区域之外也表现出良好的泛化能力,在 30 种随机初始姿态下成功将瓶子放置到目标位置,成功率达到 86.7%。
  • 策略学会了利用夹爪的顺应性,与示范相比,抓取过程中的姿态变化更小,并在放置阶段减缓运动以实现更谨慎的操作。
  • 尽管门的初始姿态存在变化,该方法在门开启任务中仍表现出高鲁棒性,证明其对接触不连续性的强适应能力。
  • 在全局策略采样阶段将 SGD 学习率降低至 10⁻⁴ 是必要的,以防止在训练区域扩大后的后期阶段遗忘先前学习到的实例。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。