Skip to main content
QUICK REVIEW

[论文解读] Including Uncertainty when Learning from Human Corrections

Dylan P. Losey, Marcia K. O’Malley|arXiv (Cornell University)|Jun 6, 2018
AI-based Problem Solving and Planning参考文献 25被引用 8
一句话总结

本文提出了一种基于卡尔曼滤波的逆强化学习方法,通过人类修正来估计最可能的人类偏好及其不确定性。通过利用不确定性进行主动学习和风险敏感的部署,该方法在存在偏差的人类修正情况下,相比最先进的最大后验概率方法,实现了更快的学习速度和更少的遗憾。

ABSTRACT

It is difficult for humans to efficiently teach robots how to correctly perform a task. One intuitive solution is for the robot to iteratively learn the human's preferences from corrections, where the human improves the robot's current behavior at each iteration. When learning from corrections, we argue that while the robot should estimate the most likely human preferences, it should also know what it does not know, and integrate this uncertainty as it makes decisions. We advance the state-of-the-art by introducing a Kalman filter for learning from corrections: this approach obtains the uncertainty of the estimated human preferences. Next, we demonstrate how the estimate uncertainty can be leveraged for active learning and risk-sensitive deployment. Our results indicate that obtaining and leveraging uncertainty leads to faster learning from human corrections.

研究动机与目标

  • 解决现有逆强化学习方法仅估计最可能的人类偏好而未追踪不确定性的局限性。
  • 使机器人能够在从人类修正中进行迭代学习的过程中,识别出哪些偏好已被充分理解,哪些仍存在不确定性。
  • 开发一种利用不确定性主动选择信息量更高的修正的方法,以提高学习效率。
  • 通过避免在修正停止后涉及高不确定性偏好的动作,支持风险敏感的部署。
  • 在违反标准噪声假设的现实、非理想的人类修正行为下评估该方法。

提出的方法

  • 该方法将人类修正建模为带有噪声的观测,并使用卡尔曼滤波器递归估计人类偏好的均值和协方差,以捕捉不确定性。
  • 卡尔曼滤波器在每次迭代中利用具有已知噪声特性的修正作为测量值,更新偏好估计及其不确定性。
  • 在主动学习中,机器人选择能最大程度减少不确定性的轨迹,具体针对偏好估计中方差较高的特征。
  • 在风险敏感的部署中,机器人即使在学习停止后也会避免涉及高不确定性偏好的轨迹。
  • 该方法使用无迹卡尔曼滤波器(UKF)以处理轨迹优化和偏好估计过程中的非线性问题。
  • 该方法通过模拟的人类修正进行评估,其中修正通过将误差最大的路径点向最优轨迹移动生成,引入偏差以测试鲁棒性。

实验结果

研究问题

  • RQ1卡尔曼滤波器能否在从修正中进行迭代学习的过程中,有效估计人类偏好的均值和不确定性?
  • RQ2与最大后验概率估计相比,利用不确定性是否能提升学习速度和准确性?
  • RQ3基于不确定性的主动学习是否能通过选择更具信息量的查询,减少所需的修正次数?
  • RQ4在无进一步修正可用的情况下,基于不确定性的风险敏感部署如何提升安全性和可靠性?
  • RQ5在现实世界中,该卡尔曼滤波方法对有偏或非高斯的人类修正有多大的鲁棒性?

主要发现

  • 卡尔曼滤波器(KF)方法在估计误差和遗憾方面均优于最先进的偏好感知器(PP),表现出更快收敛到真实人类偏好的能力。
  • 使用不确定性减少的主动学习(AL)在学习速度上优于PP,尤其在部分偏好已充分估计而其他偏好仍不确定的情况下表现更优。
  • 在存在偏差的人类修正场景下(如仅修正误差最大的路径点),卡尔曼滤波器保持了稳健性能,显示出对非理想修正模式的鲁棒性。
  • 在多个环境中,KF方法相比PP将遗憾降低了25%至40%,表明其在学习过程早期就更早地与真实人类偏好保持一致。
  • 当机器人对某项偏好(如避开桌子)初始不确定性较高时,主动学习显著比被动学习更快地降低了不确定性。
  • 该方法在非高斯修正噪声下仍能成功维持不确定性估计,验证了其在现实人机交互场景中的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。