Skip to main content
QUICK REVIEW

[论文解读] Neural-encoding Human Experts' Domain Knowledge to Warm Start Reinforcement Learning

Andrew Silva, Matthew Gombolay|arXiv (Cornell University)|Feb 15, 2019
Reinforcement Learning in Robotics参考文献 41被引用 8
一句话总结

该论文提出ProLoNets,一种新型神经网络架构,通过决策树将人类领域知识编码为命题逻辑规则,以智能初始化强化学习智能体。通过将专家知识直接嵌入网络权重和结构中,ProLoNets在基线方法基础上实现了超过80%的初始预期奖励提升,以及超过60%的训练后性能改进,即使使用非专家人类输入亦然。

ABSTRACT

Deep reinforcement learning has been successful in a variety of tasks, such as game playing and robotic manipulation. However, attempting to learn extit{tabula rasa} disregards the logical structure of many domains as well as the wealth of readily available knowledge from domain experts that could help "warm start" the learning process. We present a novel reinforcement learning technique that allows for intelligent initialization of a neural network weights and architecture. Our approach permits the encoding domain knowledge directly into a neural decision tree, and improves upon that knowledge with policy gradient updates. We empirically validate our approach on two OpenAI Gym tasks and two modified StarCraft 2 tasks, showing that our novel architecture outperforms multilayer-perceptron and recurrent architectures. Our knowledge-based framework finds superior policies compared to imitation learning-based and prior knowledge-based approaches. Importantly, we demonstrate that our approach can be used by untrained humans to initially provide >80% increase in expected reward relative to baselines prior to training (p < 0.001), which results in a >60% increase in expected reward after policy optimization (p = 0.011).

研究动机与目标

  • 为解决在复杂领域中从零开始的深度强化学习效率低下问题,利用 readily available 人类专家知识。
  • 克服模仿学习的局限性,后者需要大规模标注数据集或繁琐的人工标注。
  • 使非专家人类能够提供有效的策略规范,显著提升初始学习性能。
  • 开发一种可训练的神经网络架构,能够随时间推移提升表达能力,超越初始基于知识的初始化。
  • 通过减少对大规模计算资源、专家数据或复杂手工设计的依赖,实现强化学习的民主化。

提出的方法

  • 提出ProLoNets,一种将人类指定的命题逻辑规则(来自决策树)直接编码进网络权重和结构中的神经网络架构。
  • 使用决策树作为用户友好的界面,供领域专家或非专家通过条件-动作规则(if-then 状态-动作规则)定义高层级策略。
  • 直接从决策树初始化神经网络的架构与参数,将逻辑结构嵌入网络的连接方式与权重中。
  • 应用策略梯度更新来优化已初始化的策略,使智能体能够超越初始专家规范。
  • 引入ProLoNets的动态扩展机制,使网络在训练过程中能够扩展其容量与表达能力,以超越原始知识。
  • 利用领域中的结构与逻辑约束,减少随机探索,加速复杂环境中的收敛速度。

实验结果

研究问题

  • RQ1以决策树形式提供的、人类提供的领域知识,是否能显著提升强化学习的初始性能,而无需依赖大规模标注数据集?
  • RQ2将专家知识直接编码进神经网络架构与权重,是否能在复杂环境中超越模仿学习和标准深度强化学习基线方法?
  • RQ3非专家人类是否能提供有效的策略规范,从而实现优于随机初始化的学习结果?
  • RQ4通过策略梯度优化,神经网络在表达能力上能多大程度上超越其初始基于知识的初始化?
  • RQ5所提出的方法是否能通过实现更快收敛与更高样本效率,降低深度强化学习的计算负担?

主要发现

  • 非专家人类提供的策略规范,在未经任何训练前,使预期奖励相比基线方法提升了80%(p < 0.001)。
  • 经过策略优化后,ProLoNet智能体相比基线方法实现了60%的预期奖励提升(p = 0.011),证明了对初始知识的有效优化。
  • 在修改后的StarCraft II小游戏环境中,ProLoNets的平均奖励比表现最佳的基线方法高出超过100%,包括模仿学习与基于知识的方法。
  • 在Lunar Lander环境中,ProLoNets的动态扩展能力使智能体实现了初始策略两倍的平均奖励,超越了原始专家规范。
  • 在所有评估任务中,包括OpenAI Gym与修改后的StarCraft II环境,ProLoNets在多层感知机与循环神经网络架构上均表现更优。
  • 该框架在野火模拟领域展示了鲁棒性与实用性,未受过训练的参与者成功提供了显著优于随机初始化的初始策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。