Skip to main content
QUICK REVIEW

[论文解读] Exploring Hierarchy-Aware Inverse Reinforcement Learning

Chris Cundy, Daniel Filan|arXiv (Cornell University)|Jul 13, 2018
Reinforcement Learning in Robotics参考文献 13被引用 3
一句话总结

该论文提出贝叶斯逆向分层强化学习(BIHRL),一种通过考虑分层规划(即智能体使用可重用的选项而非原始动作)来从行为中推断人类偏好的模型。BIHRL在玩具出租车环境和Wikispeedia游戏中的表现均优于标准贝叶斯IRL,目标预测准确率达到66%,高于BIRL的62%,即使在先验对分层结构仅弱可知的情况下亦如此。

ABSTRACT

We introduce a new generative model for human planning under the Bayesian Inverse Reinforcement Learning (BIRL) framework which takes into account the fact that humans often plan using hierarchical strategies. We describe the Bayesian Inverse Hierarchical RL (BIHRL) algorithm for inferring the values of hierarchical planners, and use an illustrative toy model to show that BIHRL retains accuracy where standard BIRL fails. Furthermore, BIHRL is able to accurately predict the goals of `Wikispeedia' game players, with inclusion of hierarchical structure in the model resulting in a large boost in accuracy. We show that BIHRL is able to significantly outperform BIRL even when we only have a weak prior on the hierarchical structure of the plans available to the agent, and discuss the significant challenges that remain for scaling up this framework to more realistic settings.

研究动机与目标

  • 为解决标准逆向强化学习(IRL)在建模人类非理性行为和分层决策方面的局限性。
  • 开发一种贝叶斯框架,将人类规划建模为分层结构,使用选项(可重用的动作序列)而非原始动作。
  • 在人类采用基于子目标的分层策略的场景中,提升偏好推断的准确性。
  • 评估当真实分层结构未知或仅弱指定时,该模型的鲁棒性。
  • 在真实世界的人类轨迹数据(如Wikispeedia游戏)上,展示该方法的可扩展性和有效性。

提出的方法

  • 提出一种生成模型,将人类行为建模为在选项(高层动作)之间基于Boltzmann理性选择的行为,每个选项包含策略、启动集和终止函数。
  • 将Ramachandran & Amir(2007)提出的Policy-Walk算法扩展至分层MDP框架,实现对奖励和选项的贝叶斯推断。
  • 在最多三个确定性选项的集合上设定先验,每个选项映射到一个目标状态,以建模结构化环境中人类技能的合理性。
  • 采用马尔可夫链蒙特卡洛(MCMC)采样,对潜在选项集进行边缘化,并推断奖励函数的后验分布。
  • 将该模型应用于玩具出租车环境和Wikispeedia网络导航游戏,与标准BIRL进行性能比较。
  • 引入自洽的Boltzmann策略,其中Q值在生成动作所用的同一随机策略下计算。

实验结果

研究问题

  • RQ1是否能够设计一种考虑分层规划的贝叶斯逆向强化学习模型,使其在偏好推断上优于标准BIRL?
  • RQ2在真实世界导航任务中,引入分层选项如何影响预测人类目标的准确性?
  • RQ3当智能体选项的真实分层结构事先未知时,BIHRL在多大程度上能推断出正确的偏好?
  • RQ4当仅提供选项的弱先验时,该模型是否仍能保持相对于BIRL的性能优势?
  • RQ5在具有复杂人类行为的大规模真实环境中扩展该框架时,面临哪些计算和可扩展性挑战?

主要发现

  • 在玩具出租车环境中,BIHRL对真实奖励的后验概率质量达到0.55,而标准BIRL低于0.03,表明后验置信度提高了20倍。
  • 在Wikispeedia数据集上,BIHRL将目标预测准确率从BIRL基线的62%提升至66%,即使未使用人工设计的特征,也显示出显著的性能提升。
  • 即使在真实选项集事先未知的情况下,该模型仍能以高后验概率成功推断出正确的奖励函数,仅依赖于对合理选项的弱先验。
  • BIHRL相对于BIRL的性能优势在不同理性程度(β)下均保持稳定,表明其在人类次优行为程度各异的情况下均具有效性。
  • 尽管对所有可能选项集的完全边缘化在计算上不可行,但基于MCMC的推断过程在小规模环境中显示出可行性。
  • 结果表明,分层结构是实现准确偏好推断的关键因素,因为当智能体使用选项进行非最优规划时,标准IRL会失效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。