Skip to main content
QUICK REVIEW

[论文解读] Risk-Aware Active Inverse Reinforcement Learning

Daniel S. Brown, Yuchen Cui|arXiv (Cornell University)|Jan 8, 2019
Machine Learning and Algorithms参考文献 23被引用 19
一句话总结

本文提出风险感知主动逆强化学习(IRL),通过使用风险价值(VaR)边界优先选择在机器人策略中可能出现高泛化误差状态的查询,以最小化性能损失风险。该方法在样本效率方面优于基于熵和信息增益的方法,并为安全决策提供了紧致且可计算的性能上界。

ABSTRACT

Active learning from demonstration allows a robot to query a human for specific types of input to achieve efficient learning. Existing work has explored a variety of active query strategies; however, to our knowledge, none of these strategies directly minimize the performance risk of the policy the robot is learning. Utilizing recent advances in performance bounds for inverse reinforcement learning, we propose a risk-aware active inverse reinforcement learning algorithm that focuses active queries on areas of the state space with the potential for large generalization error. We show that risk-aware active learning outperforms standard active IRL approaches on gridworld, simulated driving, and table setting tasks, while also providing a performance-based stopping criterion that allows a robot to know when it has received enough demonstrations to safely perform a task.

研究动机与目标

  • 为解决现有主动IRL方法缺乏性能风险意识的问题,这些方法侧重于减少不确定性而非实际策略风险。
  • 使机器人能够在其学习策略在真实奖励函数下泛化能力较差的状态下主动向人类查询。
  • 提供一种基于性能的停止准则,用以判断何时已收集足够演示以实现安全任务执行。
  • 利用近期在IRL紧致性能边界方面的进展,使主动学习决策基于实际策略风险而非不确定性。

提出的方法

  • 该方法使用贝叶斯IRL维护从示范轨迹中获得的奖励函数后验分布。
  • 通过估计奖励函数后验分布中的最坏情况性能,计算每个候选查询配置的政策损失风险价值(VaR)。
  • 机器人选择α-VaR(例如0.95-VaR)最高的查询配置,以最小化大泛化误差的风险。
  • 采用MCMC采样估计奖励函数的后验分布,并相对于MAP奖励函数计算放置损失,以确定VaR。
  • 该方法集成了停止条件:当0.95-VaR边界低于预设阈值时,表明可安全部署策略。
  • 该方法在网格世界、模拟驾驶和真实机器人桌面摆放任务中进行了评估,使用合成演示和真实世界验证。

实验结果

研究问题

  • RQ1能否设计一种主动IRL方法,使其基于政策泛化误差风险而非不确定性或信息增益来优先选择查询?
  • RQ2基于VaR的性能边界能否在真实奖励未知时,为政策损失提供紧致且有意义的上界?
  • RQ3与标准主动IRL方法相比,风险感知查询选择是否能实现更快收敛和更低的泛化误差?
  • RQ4VaR边界能否作为IRL中主动学习的可靠停止准则?

主要发现

  • 在桌面摆放任务中,风险感知主动IRL的平均放置误差显著低于随机和基于熵的查询策略,在10次演示中误差降低了30%-50%。
  • 0.95-VaR上界在所有实验中均准确且紧密地界定了实际最坏情况放置损失,且随着演示数量增加,边界逐渐变得更紧。
  • 该方法的计算量比基于信息增益的主动IRL低三个数量级,同时实现了相当或更优的性能。
  • 该方法实现了有意义的停止条件:当0.95-VaR边界降至阈值以下时,机器人可安全执行任务而无需进一步查询。
  • 在模拟驾驶和网格世界任务中,风险感知查询比基于熵的查询更有效地降低了政策泛化误差,尤其在高不确定性区域表现更优。
  • 真实机器人验证表明,通过风险感知查询学习到的策略在新测试配置下的泛化能力优于随机或基于熵的查询所学策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。