Skip to main content
QUICK REVIEW

[论文解读] AvE: Assistance via Empowerment

Yuqing Du, Stas Tiomkin|arXiv (Cornell University)|Jun 26, 2020
Robot Manipulation and Learning参考文献 48被引用 14
一句话总结

本文提出了通过赋能实现协助(AvE),这是一种无目标导向的方法,通过代理学习以增强人类对环境的可控性,从而提升人类自主性。在共享自主性用户研究中,AvE 在目标模糊或设定错误的情境下优于基于目标推理的基线方法,显著提高了人类的成功率,尽管任务完成时间略有延迟。

ABSTRACT

One difficulty in using artificial agents for human-assistive applications lies in the challenge of accurately assisting with a person's goal(s). Existing methods tend to rely on inferring the human's goal, which is challenging when there are many potential goals or when the set of candidate goals is difficult to identify. We propose a new paradigm for assistance by instead increasing the human's ability to control their environment, and formalize this approach by augmenting reinforcement learning with human empowerment. This task-agnostic objective preserves the person's autonomy and ability to achieve any eventual state. We test our approach against assistance based on goal inference, highlighting scenarios where our method overcomes failure modes stemming from goal ambiguity or misspecification. As existing methods for estimating empowerment in continuous domains are computationally hard, precluding its use in real time learned assistance, we also propose an efficient empowerment-inspired proxy metric. Using this, we are able to successfully demonstrate our method in a shared autonomy user study for a challenging simulated teleoperation task with human-in-the-loop training.

研究动机与目标

  • 解决人类目标未知或模糊时的协助挑战,这会削弱传统基于目标推理的协助方法的效果。
  • 通过避免对人类意图或奖励函数的假设,保护人类自主性。
  • 将人机协作形式化为一种无任务依赖的目标,即通过赋能提升人类达到任意期望状态的能力。
  • 设计一种计算高效的赋能代理指标,以实现实时部署于人机协同场景。
  • 通过涉及模拟远程操作任务的共享自主性用户研究,对方法进行实证验证。

提出的方法

  • 该方法将协助形式化为在强化学习中引入人类赋能目标,其中代理通过最大化从人类当前状态可达的未来状态数的对数来实现。
  • 提出一种高效、受赋能启发的代理度量指标,通过在同质噪声假设下估计可达状态的多样性,近似真实赋能。
  • 该代理度量避免了在连续领域中精确估算赋能的计算不可行性,从而实现实时部署。
  • 代理学习的策略优先选择能提升人类未来选择余地的动作,从而在不预先知晓目标的情况下增强可控性。
  • 通过一项涉及动力系统(如 Lunar Lander)远程操作的模拟共享自主性任务用户研究评估该方法。
  • 将该方法与基于目标推理的基线方法进行比较,性能指标包括人类成功概率和任务完成时间。

实验结果

研究问题

  • RQ1基于赋能的无目标导向协助方法是否能在目标推理因模糊性或错误设定而失效的任务中,提升人类的成功率?
  • RQ2当真实目标未知或建模错误时,基于赋能的协助方法与基于目标推理的协助方法相比表现如何?
  • RQ3能否设计一种高效的赋能代理指标,在保留赋能核心直觉的同时,实现实时学习和人机协同部署?
  • RQ4在共享自主性场景中,提升人类赋能是否能带来更稳定和可控的系统行为?
  • RQ5在使用基于赋能的协助与基于目标信息的协助时,人类成功概率与任务完成速度之间存在何种权衡?

主要发现

  • AvE 在目标模糊或设定错误的情境下显著提升了人类成功率,优于基于目标推理的基线方法,尤其在这些方法失效的场景中表现突出。
  • 当目标集合正确且规模较小时,基于目标推理的方法仍优于 AvE,表明在鲁棒性与速度之间存在权衡。
  • 所提出的受赋能启发的代理度量指标虽非真实赋能的精确度量,但成功实现了实时学习与人机协同用户研究中的有效部署。
  • 该方法在共享自主性任务中自然促进了系统稳定,从而提高了人类成功概率。
  • 用户研究证明,AvE 即使在不了解人类目标的情况下也能提供有效协助,验证了其作为通用协助框架的潜力。
  • 结果表明,通过提升人类可控性来赋能人类,可作为目标推理的稳健替代方案,尤其适用于高风险或不确定的环境。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。