Skip to main content
QUICK REVIEW

[论文解读] Reinforcement Learning from Imperfect Demonstrations under Soft Expert Guidance

Mingxuan Jing, Xiaojian Ma|arXiv (Cornell University)|Nov 16, 2019
Reinforcement Learning in Robotics参考文献 33被引用 9
一句话总结

本文提出了一种约束型从演示中强化学习(RLfD)方法,将专家演示视为软约束而非刚性奖励,从而实现从不完美演示中有效学习。通过将策略优化表述为约束问题,并利用基于对偶的局部线性搜索求解,该方法在基准控制任务上表现出色,即使在低质量或稀疏演示下也优于基于惩罚和预训练的基线方法。

ABSTRACT

In this paper, we study Reinforcement Learning from Demonstrations (RLfD) that improves the exploration efficiency of Reinforcement Learning (RL) by providing expert demonstrations. Most of existing RLfD methods require demonstrations to be perfect and sufficient, which yet is unrealistic to meet in practice. To work on imperfect demonstrations, we first define an imperfect expert setting for RLfD in a formal way, and then point out that previous methods suffer from two issues in terms of optimality and convergence, respectively. Upon the theoretical findings we have derived, we tackle these two issues by regarding the expert guidance as a soft constraint on regulating the policy exploration of the agent, which eventually leads to a constrained optimization problem. We further demonstrate that such problem is able to be addressed efficiently by performing a local linear search on its dual form. Considerable empirical evaluations on a comprehensive collection of benchmarks indicate our method attains consistent improvement over other RLfD counterparts.

研究动机与目标

  • 为解决现有RLfD方法依赖完美且充分演示的局限性,而这种条件在真实场景中不切实际。
  • 形式化一种新的RLfD设置,其特征为专家质量欠佳且演示数量不足。
  • 克服基于惩罚的RLfD方法在应用于不完美专家时出现的最优性与收敛性问题。
  • 开发一种可扩展、高效的算法,通过在策略学习过程中软性强制约束来利用不完美演示。
  • 通过实证验证该方法在不同演示质量与数量下的优越性。

提出的方法

  • 将RLfD表述为约束型策略优化问题,使策略被限制在演示轨迹附近的有界区域内。
  • 将专家演示视为软约束,仅在智能体策略偏离演示区域时影响策略更新。
  • 使用约束问题的对偶形式以降低计算复杂度,并实现对深度神经网络策略的可扩展性。
  • 在对偶目标上执行局部线性搜索,以在每一步训练中高效计算策略更新。
  • 引入一个容忍度参数 $d$,用于控制围绕演示的探索半径,并采用退火机制随时间逐渐放松约束。
  • 在离策略RL算法中应用于连续控制基准,将软约束集成到策略更新中,而无需修改奖励塑造。

实验结果

研究问题

  • RQ1当专家演示在质量或数量上不完美时,现有RLfD方法的表现如何?
  • RQ2软约束形式是否能同时提升在不完美演示下RLfD的最优性与收敛性?
  • RQ3约束容忍度及其退火调度对策略性能有何影响?
  • RQ4与基于惩罚和预训练的RLfD方法相比,所提出的约束优化方法在样本效率与最终性能方面表现如何?
  • RQ5该方法在不同环境中对演示质量与数量变化的鲁棒性如何?

主要发现

  • 所提方法在多个连续控制基准上始终优于基于惩罚和预训练的RLfD基线方法,即使演示不完美。
  • 在高质量演示下,该方法仍优于基线,表明其对专家数据的利用更高效。
  • 容忍度过大会使约束失效,而过小则会损害在不完美演示下的性能,凸显了精细调参的必要性。
  • 容忍度的退火机制显著提升性能与鲁棒性,且在不同退火因子下结果稳定。
  • 消融实验表明,固定容忍度的性能劣于退火容忍度,且该方法对退火因子的微小变化具有鲁棒性。
  • 在HalfCheetah、Walker2D和Ant任务中,该方法在最终性能上表现更优,尤其在演示质量低或数量稀少时优势明显。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。