Skip to main content
QUICK REVIEW

[论文解读] On-Policy Robot Imitation Learning from a Converging Supervisor

Ashwin Balakrishna, Brijen Thananjeyan|arXiv (Cornell University)|Jul 8, 2019
Reinforcement Learning in Robotics参考文献 33被引用 12
一句话总结

本文提出了一种新颖的在线策略模仿学习框架,能够从随时间演化并最终收敛的监督者(如人类或性能不断提升的算法控制器)中高效训练策略。通过形式化在收敛监督者下的遗憾边界,并将该方法与对偶策略迭代相联系,该方法在保持数据效率的同时,相较于最先进模型-based强化学习方法,实现了高达80倍的策略评估速度提升,该方法已在模拟环境和物理机器人系统(包括达芬奇外科手术机器人)中得到验证。

ABSTRACT

Existing on-policy imitation learning algorithms, such as DAgger, assume access to a fixed supervisor. However, there are many settings where the supervisor may evolve during policy learning, such as a human performing a novel task or an improving algorithmic controller. We formalize imitation learning from a "converging supervisor" and provide sublinear static and dynamic regret guarantees against the best policy in hindsight with labels from the converged supervisor, even when labels during learning are only from intermediate supervisors. We then show that this framework is closely connected to a class of reinforcement learning (RL) algorithms known as dual policy iteration (DPI), which alternate between training a reactive learner with imitation learning and a model-based supervisor with data from the learner. Experiments suggest that when this framework is applied with the state-of-the-art deep model-based RL algorithm PETS as an improving supervisor, it outperforms deep RL baselines on continuous control tasks and provides up to an 80-fold speedup in policy evaluation.

研究动机与目标

  • 为解决现有在线策略模仿学习方法中假设监督者固定不变的局限性,该假设无法反映现实世界中监督者(如人类或性能不断提升的算法)随时间演化的实际情况。
  • 为具有收敛监督者的在线策略模仿学习形式化理论框架,提供相对于事后最优策略的次线性遗憾保证。
  • 通过证明收敛监督者设定可推广并放宽现有对偶策略迭代(DPI)方法中的结构假设,弥合模仿学习与对偶策略迭代(DPI)之间的鸿沟。
  • 通过将一个缓慢但持续改进的监督者(如PETS)蒸馏为快速响应的策略,加速深度模型-based强化学习中的策略评估,同时不牺牲数据效率。
  • 在仿真环境和物理达芬奇外科手术机器人上对方法进行实证验证,展示在查询时间和评估时间上的显著加速。

提出的方法

  • 该框架在收敛监督者的背景下引入了静态与动态遗憾的新概念,其中标签由学习过程中的中间监督者提供,但最终性能以收敛后的监督者为基准进行评估。
  • 该方法将收敛监督者设定下的遗憾分析简化为标准的固定监督者设定,从而在温和假设下实现次线性遗憾保证。
  • 其采用类似对偶策略迭代(DPI)的循环机制:在通过在线策略模仿学习训练快速响应策略与利用当前策略数据改进模型-based监督者之间交替进行。
  • 允许监督者为任何能在学习者分布上收敛到良好策略的算法,包括PETS等深度模型-based强化学习方法,且无需施加结构约束。
  • 快速响应策略通过在线策略模仿学习(如DAgger风格)进行训练,其标签来自随时间演化的当前监督者。
  • 该框架通过将监督者的样本效率(如PETS)保留下来,同时通过蒸馏将在线推理成本大幅降低,从而保持数据效率。

实验结果

研究问题

  • RQ1当监督者并非固定而是随时间收敛时,我们能否为在线策略模仿学习提供理论上的遗憾保证?
  • RQ2即使训练期间仅由中间监督者提供标签,是否仍能实现与最终收敛监督者相当的良好性能?
  • RQ3所提出的框架与现有对偶策略迭代(DPI)算法之间有何关系?是否能放宽其结构假设?
  • RQ4该框架能否在不牺牲数据效率的前提下,加速深度模型-based强化学习中的策略评估?
  • RQ5在真实机器人系统中应用如PETS这类最先进监督者时,该方法在推理速度和训练效率方面实际获得了哪些收益?

主要发现

  • 在标准假设下,即使标签仅来自中间监督者,该方法仍能实现相对于事后最优策略的次线性静态与动态遗憾。
  • 当使用PETS作为改进型监督者时,该框架在保持PETS数据效率的同时,使模拟环境中策略查询时间最高缩短80倍。
  • 在物理达芬奇外科手术机器人上,CSF学习者相比PETS将策略查询时间最多减少20倍,策略评估时间减少53%,尽管硬件限制了最大控制频率。
  • 在物理机器人上单臂与双臂抓取任务中,CSF学习者有效跟踪了PETS监督者,展现出强大的泛化能力与控制精度。
  • 与深度强化学习基线相比,该方法在连续控制任务中表现显著更优,收敛更快且样本效率更高,这得益于对高质量、持续改进的监督者的蒸馏。
  • 该框架通过大幅降低在线推理成本同时保持性能,使模型-based强化学习策略在实时机器人系统中实现实际部署成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。