Skip to main content
QUICK REVIEW

[论文解读] Learning under Misspecified Objective Spaces

Andreea Bobu, Andrea Bajcsy|arXiv (Cornell University)|Oct 11, 2018
Explainable Artificial Intelligence (XAI)被引用 5
一句话总结

本文提出了一种机器人在任务执行过程中实时评估物理人类修正相关性的实时方法,避免当人类意图超出机器人假设空间时产生非预期的学习。通过评估修正是否与已知目标一致,机器人以保守方式学习——在用户研究中表现出更少的遗憾和非预期更新,同时保持对相关修正的性能。

ABSTRACT

Learning robot objective functions from human input has become increasingly important, but state-of-the-art techniques assume that the human's desired objective lies within the robot's hypothesis space. When this is not true, even methods that keep track of uncertainty over the objective fail because they reason about which hypothesis might be correct, and not whether any of the hypotheses are correct. We focus specifically on learning from physical human corrections during the robot's task execution, where not having a rich enough hypothesis space leads to the robot updating its objective in ways that the person did not actually intend. We observe that such corrections appear irrelevant to the robot, because they are not the best way of achieving any of the candidate objectives. Instead of naively trusting and learning from every human interaction, we propose robots learn conservatively by reasoning in real time about how relevant the human's correction is for the robot's hypothesis space. We test our inference method in an experiment with human interaction data, and demonstrate that this alleviates unintended learning in an in-person user study with a 7DoF robot manipulator.

研究动机与目标

  • 解决机器人奖励学习中的模型误设问题,即人类偏好落在机器人预定义假设空间之外。
  • 在机器人目标空间不完整或误设时,减少因物理人机修正而产生的非预期学习。
  • 使机器人能够实时推理修正的相关性,区分有信息量和无关的人机交互。
  • 通过检测人类修正是否在其当前任务理解下是理性的,改善人机协作中的对齐性。
  • 在避免对无关或误解输入过拟合的同时,保持对相关修正的性能。

提出的方法

  • 机器人使用贝叶斯推理框架,评估在当前目标假设空间下,人类修正是否合理。
  • 通过检查状态变化是否可通过已知目标更高效实现,来评估修正的相关性,基于最小努力原则计算合理性评分。
  • 该方法计算一个相关性评分 $ r \in \{0,1\} $,其中 $ r=1 $ 表示修正与已知目标一致,因此具有信息量。
  • 机器人仅在修正被认为相关时才更新其目标函数,从而避免学习与任何已知目标不一致的行为。
  • 将此相关性检查集成到使用阻抗控制器和状态特征线性奖励函数的在线实时轨迹重规划中。
  • 该方法使用带有真实人机交互数据的机械臂进行测试,并与始终在修正后更新的基线方法进行性能对比。

实验结果

研究问题

  • RQ1机器人能否检测到物理人机修正与当前目标假设空间无关?
  • RQ2基于修正相关性的保守学习在人机交互中如何影响遗憾和非预期学习?
  • RQ3与标准学习方法相比,该方法在修正相关任务中是否保持了性能?
  • RQ4当机器人应用此相关性检查时,用户在多大程度上感知到非预期学习的减少?
  • RQ5实时合理性评估在目标空间误设的情况下能否改善人类意图与机器人行为之间的对齐?

主要发现

  • 在存在无关修正的任务中,所提方法相比基线显著减少了遗憾(p = 0.001),表明非预期学习减少。
  • 在存在相关修正的任务中,所提方法与基线在遗憾方面无显著差异(p = 0.9991),表明性能无退化。
  • 所学权重更新路径长度($ \hat{\theta} $)在所提方法下显著更短,表明学习更稳定高效。
  • 参与者显著更偏好所提方法以减少非预期学习(F(1,7) = 9.15, p = 0.0046),在任务完成度和理解度方面无显著差异。
  • 主观调查结果确认,用户感觉机器人更理解其意图,且对任务中已正确部分的错误更新更少。
  • 该方法成功防止机器人学习向桌子靠近,而人类意图是增加与自身的距离,从而避免了关键的错位。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。