[论文解读] Newtonian Action Advice: Integrating Human Verbal Instruction with Reinforcement Learning
本文提出牛顿行动建议(NAA),一种将人类口头行动建议(例如“向左移动”)整合到强化学习中的方法,通过基于物理的模型提升学习效率与人类体验。即使人类输入显著减少,NAA在强化学习指标(如更高的累积奖励和更快的训练速度)和人类因素(如减少挫败感和提升感知智能)方面均优于策略塑造(Policy Shaping)。
A goal of Interactive Machine Learning (IML) is to enable people without specialized training to teach agents how to perform tasks. Many of the existing machine learning algorithms that learn from human instructions are evaluated using simulated feedback and focus on how quickly the agent learns. While this is valuable information, it ignores important aspects of the human-agent interaction such as frustration. In this paper, we present the Newtonian Action Advice agent, a new method of incorporating human verbal action advice with Reinforcement Learning (RL) in a way that improves the human-agent interaction. In addition to simulations, we validated the Newtonian Action Advice algorithm by conducting a human-subject experiment. The results show that Newtonian Action Advice can perform better than Policy Shaping, a state-of-the-art IML algorithm, both in terms of RL metrics like cumulative reward and human factors metrics like frustration.
研究动机与目标
- 开发一种交互式机器学习方法,使非专家能够通过自然语言指令教导智能体。
- 解决现有交互式机器学习系统中重强化学习性能而轻视人类体验指标(如挫败感与清晰度)的缺陷。
- 设计一种算法,根据智能体的实时行为动态整合并覆盖口头建议,模拟人类学习的动态过程。
- 通过模拟和真人受试者实验双重验证算法,同时衡量强化学习性能与用户体验。
- 证明积极的人机交互体验对持续人机协作至关重要,并可通过算法设计系统性地优化。
提出的方法
- NAA利用基于物理的模型,以符合人类对智能体行为预期的方式解释并执行人类口头行动建议(例如“向左移动”)。
- 该算法通过将建议视为策略约束,将其整合到贝叶斯Q-learning中,基于智能体的当前状态和动作修改Q值更新。
- 建议不会被永久编码;相反,新建议可覆盖先前建议,实现对变化指令的动态适应。
- 通过模拟器中的“预言机”评估在不同建议频率(20%、50%、90%)下的性能,与策略塑造和贝叶斯Q-learning进行对比。
- 开展真人受试实验,参与者分别指导NAA和策略塑造智能体,报告挫败感、透明度、即时响应性及感知智能水平。
- 通过训练后问卷收集用户体验指标,并使用配对t检验比较两种智能体的表现。
实验结果
研究问题
- RQ1在使用等量人类输入的前提下,牛顿行动建议是否能提升强化学习的学习效率,相比策略塑造?
- RQ2与策略塑造相比,NAA是否能降低用户挫败感,并提升感知清晰度与即时响应性?
- RQ3在模拟与真实人类互动中,人类建议的频率如何影响NAA与策略塑造的性能表现?
- RQ4人类因素(如感知即时响应性与透明度)在多大程度上影响交互式机器学习系统的成功?
- RQ5对口头建议进行基于物理的解释,是否能带来更直观、可预测的智能体行为,使其更符合人类预期?
主要发现
- 即使仅使用20%的建议频率,NAA的累积奖励仍高于策略塑造,而策略塑造需达到98%的建议频率才能匹配性能。
- NAA智能体的平均训练时间显著更短,表明尽管人类输入更少,其收敛速度更快。
- 参与者报告称,NAA智能体在响应建议时更少令人挫败,更清晰,响应更即时,相比策略塑造智能体有显著优势。
- 参与者认为NAA智能体更具智能,更善于按预期完成任务,所有用户体验指标均显示统计显著提升。
- 尽管性能存在差距,但两种交互方式下人类提供的总输入量无统计学差异,证实NAA更高效地利用了建议。
- 本研究表明,使用预言机模拟人类反馈存在局限性,尤其在建模人类挫败感与意图方面,凸显了真人受试验证的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。