Skip to main content
QUICK REVIEW

[论文解读] Curriculum Design for Teaching via Demonstrations: Theory and Applications

Gaurav Yengera, Rati Devidze|arXiv (Cornell University)|Jun 8, 2021
Reinforcement Learning in Robotics被引用 4
一句话总结

该论文提出了一种统一的、交互式的课程策略,用于通过示范进行模仿学习,基于教师最优策略与学习者当前策略下示范的似然比对示范进行难度排序。该方法在不访问学习者内部动态的情况下,实现了MaxEnt-IRL和CrossEnt-BC学习者的线性收敛,并通过基于任务特定难度分数的策略扩展至无教师设置,在合成导航和汽车驾驶环境中优于先前方法。

ABSTRACT

We consider the problem of teaching via demonstrations in sequential decision-making settings. In particular, we study how to design a personalized curriculum over demonstrations to speed up the learner's convergence. We provide a unified curriculum strategy for two popular learner models: Maximum Causal Entropy Inverse Reinforcement Learning (MaxEnt-IRL) and Cross-Entropy Behavioral Cloning (CrossEnt-BC). Our unified strategy induces a ranking over demonstrations based on a notion of difficulty scores computed w.r.t. the teacher's optimal policy and the learner's current policy. Compared to the state of the art, our strategy doesn't require access to the learner's internal dynamics and still enjoys similar convergence guarantees under mild technical conditions. Furthermore, we adapt our curriculum strategy to the setting where no teacher agent is present using task-specific difficulty scores. Experiments on a synthetic car driving environment and navigation-based environments demonstrate the effectiveness of our curriculum strategy.

研究动机与目标

  • 为减少高效模仿学习所需的示范数量,设计个性化课程以应对挑战。
  • 开发一种对学习者内部动态无感的课程策略,以实现对不同学习者模型的广泛适用性。
  • 通过使用任务特定的难度分数,将课程方法扩展至无教师代理的设置。
  • 在温和的技术条件下,为MaxEnt-IRL和CrossEnt-BC学习者提供理论收敛保证。
  • 在合成导航和汽车驾驶环境中实证验证课程策略的有效性。

提出的方法

  • 课程策略基于教师最优策略下与学习者当前策略下示范的似然比对示范进行排序,作为难度评分。
  • 对于MaxEnt-IRL,该方法在温和技术条件下证明了线性收敛,且无需了解学习者的更新规则。
  • 对于CrossEnt-BC,采用相同的基于难度的排序方法,实现了两种学习者模型间的统一课程策略。
  • 使用调度机制逐步增加每轮训练中提供的示范数量,从最优先(最难)的示范开始,最终包含全部示范。
  • 在无教师的情况下,通过环境的结构特性(如目标数量或贪婪差距)推导出任务特定的难度分数,以指导课程生成。
  • 该方法在合成汽车驾驶环境及两个基于导航的环境中进行了评估,采用神经网络进行训练,并使用课程调度的示范批次。

实验结果

研究问题

  • RQ1能否仅使用基于策略的难度评分,为MaxEnt-IRL和CrossEnt-BC学习者设计统一的课程策略?
  • RQ2所提出的课程是否能在不访问学习者内部动态的情况下,实现MaxEnt-IRL的线性收敛?
  • RQ3能否仅使用任务特定特征,将课程策略适配至无教师代理的设置?
  • RQ4与先前的批量和交互式教学方法相比,该课程策略在收敛速度和样本效率方面表现如何?
  • RQ5课程选择中出现了哪些结构性模式?这些模式是否与导航任务中的直观学习进程一致?

主要发现

  • 所提出的课程策略在温和技术条件下实现了MaxEnt-IRL学习者的线性收敛,即使不访问学习者的更新规则亦成立。
  • 在最短路径导航环境中,课程早期优先选择目标较少、障碍物较多的任务,先教授避障技能,再学习最优路径选择。
  • 在TSP导航环境中,课程从目标较多但贪婪差距较低的任务开始,逐步引入更复杂的规划任务。
  • 与均匀分布和随机示范调度相比,该课程策略在两个合成环境中显著加速了学习收敛。
  • 通过利用目标数量和贪婪差距等环境特征推导出的任务特定难度分数,该方法在无教师设置中表现出良好的泛化能力。
  • 实证结果表明,该课程策略在样本效率和收敛速度方面优于最先进方法,尤其在复杂导航任务中表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。