Skip to main content
QUICK REVIEW

[论文解读] Cycle-of-Learning for Autonomous Systems from Human Interaction

Nicholas R. Waytowich, Vinicius G. Goecks|arXiv (Cornell University)|Aug 28, 2018
Reinforcement Learning in Robotics参考文献 11被引用 14
一句话总结

本文提出了Cycle-of-Learning框架,这是一种将人类交互模态——示范、干预和评估——整合到统一强化学习流程中的新颖方法,适用于自主系统。通过按顺序利用人类示范进行策略预训练,利用干预优化评论家,再过渡到人类评估与自监督强化学习,该框架实现了高效、自适应的学习过程,并随时间推移逐步减少人类参与。

ABSTRACT

We discuss different types of human-robot interaction paradigms in the context of training end-to-end reinforcement learning algorithms. We provide a taxonomy to categorize the types of human interaction and present our Cycle-of-Learning framework for autonomous systems that combines different human-interaction modalities with reinforcement learning. Two key concepts provided by our Cycle-of-Learning framework are how it handles the integration of the different human-interaction modalities (demonstration, intervention, and evaluation) and how to define the switching criteria between them.

研究动机与目标

  • 解决在真实环境中训练自主系统时奖励函数难以计算或不可用的挑战。
  • 形式化一个统一的学习框架,将多种人类交互模态——示范、干预和评估——整合到单一、连贯的训练过程中。
  • 通过根据性能、数据可用性或优势函数动态切换交互模态,减轻人类训练者的负担。
  • 实现从高程度人类参与(示范和干预)到系统自主性逐步提升(评估和纯强化学习)的平稳过渡。

提出的方法

  • 提出一个三阶段学习循环:(1) 从人类示范中学习(LFD),(2) 从人类干预中学习(LFI),(3) 从人类评估中学习(LFE),随后进入纯强化学习(RL)。
  • 采用演员-评论家架构,其中演员首先通过示范和干预进行训练,随后评论家通过人类提供的反馈和时序差分学习进行训练。
  • 使用逆强化学习(IRL)从人类示范中推断奖励函数,使系统能够学习到一个奖励模型 $ R_H $。
  • 将学习到的奖励模型 $ R_H $ 整合到标准的演员-评论家强化学习框架中,使用策略梯度方法优化策略 $ \pi_{\theta D_H} $。
  • 利用性能指标、数据模态限制和优势函数 $ A(s,a) = Q(s,a) - V(s) $ 定义模态之间的切换准则。
  • 利用优势函数比较人类与系统的表现,当系统在期望回报上超过人类时,实现向自主强化学习的自动过渡。

实验结果

研究问题

  • RQ1如何系统性地将多种人类交互模态——示范、干预和评估——整合到一个统一、连贯的自主系统学习框架中?
  • RQ2应基于何种标准来管理不同交互模态之间的切换,以在学习效率与人类资源约束之间取得平衡?
  • RQ3如何从人类示范和干预中学习奖励模型,以实现在无需人工设计奖励函数的情况下进行下游强化学习?
  • RQ4在减少人类参与的同时,系统应以何种方式逐步提升自主性?
  • RQ5性能指标、数据可用性和优势函数在确定交互模式之间最优切换点时发挥何种作用?

主要发现

  • Cycle-of-Learning框架实现了从人类引导学习(示范和干预)到自主强化学习的结构化、顺序性过渡,显著降低了对持续人类输入的依赖。
  • 通过先在示范和干预上训练演员,该框架相比从随机初始化开始的纯强化学习,显著提升了样本效率和收敛速度。
  • IRL的整合使系统能够从人类行为中推断奖励函数,从而在后续强化学习优化中使用学习到的奖励模型。
  • 优势函数 $ A(s,a) $ 提供了量化依据,用于判断何时系统的性能超过人类,从而发出向自主运行过渡的有效信号。
  • 基于性能指标或数据可用性的切换机制使框架能够适应现实世界中人类交互的限制,如示范时间有限或反馈容量受限。
  • 该框架专为机器人应用设计,兼顾人类与系统资源的有限性,提供了一种可扩展且直观的人机协同学习范式。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。