Skip to main content
QUICK REVIEW

[论文解读] Learning Self-Correctable Policies and Value Functions from Demonstrations with Negative Sampling

Yuping Luo, Huazhe Xu|arXiv (Cornell University)|Jul 12, 2019
Reinforcement Learning in Robotics参考文献 58被引用 4
一句话总结

本文提出价值迭代负采样(VINS),一种从专家演示中学习保守外推价值函数的方法,以在模仿学习中实现自纠正策略。通过使用负采样惩罚对未见状态的过度乐观价值外推,VINS 提高了样本效率,并在稀疏奖励机器人控制任务的行为克隆和强化学习微调中优于先前方法。

ABSTRACT

Imitation learning, followed by reinforcement learning algorithms, is a promising paradigm to solve complex control tasks sample-efficiently. However, learning from demonstrations often suffers from the covariate shift problem, which results in cascading errors of the learned policy. We introduce a notion of conservatively-extrapolated value functions, which provably lead to policies with self-correction. We design an algorithm Value Iteration with Negative Sampling (VINS) that practically learns such value functions with conservative extrapolation. We show that VINS can correct mistakes of the behavioral cloning policy on simulated robotics benchmark tasks. We also propose the algorithm of using VINS to initialize a reinforcement learning algorithm, which is shown to outperform significantly prior works in sample efficiency.

研究动机与目标

  • 解决模仿学习中的协变量偏移问题,即策略和价值函数因分布偏移而无法泛化到未见状态。
  • 克服虚假价值函数外推导致的策略执行中误差累积问题。
  • 提出一种理论基础扎实的方法,学习偏好停留在演示轨迹附近的值函数,通过为演示附近但不在演示集中的未见状态分配较低值来实现。
  • 通过使用 VINS 初始化 Q 函数和动力学模型,提升强化学习中的样本效率,减少对大量预热的依赖。
  • 证明 VINS 能够纠正行为克隆中的错误,并在基准机器人控制任务中实现比先前方法更高的样本效率。

提出的方法

  • 引入保守外推价值函数的概念,为靠近演示但不在演示集中的状态分配较低值,以促进策略的自纠正。
  • 设计 VINS 算法,通过负采样学习此类价值函数,其中负样本通过在演示状态上添加高斯噪声生成。
  • 制定一个损失函数,结合演示状态上的监督学习和负采样损失,后者惩罚不在演示集中的扰动状态的高值。
  • 使用监督学习在演示轨迹上学习动力学模型,以预测下一状态,从而通过值函数最大化实现动作选择。
  • 使用学习到的价值函数和动力学模型初始化强化学习算法,减少对 Q 函数预热的依赖。
  • 在行为克隆策略动作附近进行动作搜索,以在动力学模型远离演示数据时提高鲁棒性。

实验结果

研究问题

  • RQ1我们能否设计一种在未见状态上保守外推的价值函数,从而在模仿学习中实现自纠正策略?
  • RQ2如何利用负采样学习价值函数,以避免在远离演示数据区域产生过度乐观的预测?
  • RQ3与先前方法相比,使用 VINS 初始化强化学习算法在多大程度上提升了样本效率?
  • RQ4负采样、动力学模型以及在 BC 动作附近的动作搜索这三个组件对 VINS 总体性能的贡献分别是什么?
  • RQ5所提出的方法能否纠正行为克隆策略在稀疏奖励机器人控制任务中产生的错误?

主要发现

  • VINS 显著提升了在模拟机器人控制任务中行为克隆的性能,在 Pick-100 上达到 75.7% 的成功率,在 Push-100 上达到 55.2%,而 BC 单独使用时分别为 66.8% 和 37.3%。
  • 消融实验表明,若移除负采样,性能下降至 Pick-100 上的 48.5%,表明负采样在防止虚假外推中至关重要。
  • 在无行为克隆监督的情况下,VINS 表现欠佳(Pick-100 上为 28.5%),表明 BC 动作对稳定策略初始化至关重要。
  • 即使不使用 BC 动作,仅使用理想动力学模型仍可达到 Pick-100 上 51.4% 的成功率,表明动力学模型质量是主要瓶颈。
  • 当用于初始化强化学习时,VINS 超过先前最先进方法(如 Nair et al., 2018),在更少的环境交互次数下实现接近最优的成功率。
  • 学习曲线显示,VINS 初始化的强化学习收敛更快,且在早期训练阶段即能以更少样本达到高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。