[论文解读] Learning from Richer Human Guidance: Augmenting Comparison-Based Learning with Feature Queries
本文提出通过引入特征查询来增强基于比较的奖励学习——不仅询问用户在两条机器人轨迹中更偏好哪一条,还询问是哪些具体特征(例如速度、平滑度)导致了该偏好。通过将比较结果和特征回答均建模为对真实奖励的噪声观测,该方法利用主动查询选择策略,高效推断用户偏好,在模拟环境和真实用户研究中均显著优于仅使用比较的奖励学习方法。
We focus on learning the desired objective function for a robot. Although trajectory demonstrations can be very informative of the desired objective, they can also be difficult for users to provide. Answers to comparison queries, asking which of two trajectories is preferable, are much easier for users, and have emerged as an effective alternative. Unfortunately, comparisons are far less informative. We propose that there is much richer information that users can easily provide and that robots ought to leverage. We focus on augmenting comparisons with feature queries, and introduce a unified formalism for treating all answers as observations about the true desired reward. We derive an active query selection algorithm, and test these queries in simulation and on real users. We find that richer, feature-augmented queries can extract more information faster, leading to robots that better match user preferences in their behavior.
研究动机与目标
- 解决在轨迹示范难以或误导用户提供的场景下,学习机器人奖励函数的挑战。
- 在比较学习(用户操作简单但信息量有限)的基础上,通过引入关于为何一条轨迹优于另一条的特征解释,实现改进。
- 构建一个统一的概率框架,将比较答案和特征答案均视为对真实奖励函数的噪声观测。
- 设计一种主动查询选择策略,以每轮查询最大化信息增益,从而加速收敛到正确的奖励参数。
- 通过实证验证,更丰富的查询能够生成更优的奖励模型,并在模拟和真实世界用户研究中实现更符合用户期望的机器人行为。
提出的方法
- 该方法将人类回答建模为在真实奖励参数 θ 条件下的噪声最优决策,将比较答案和特征答案均视为贝叶斯推理框架中的观测值。
- 采用线性奖励函数 r(x,u) = θᵀφ(x,u),其中 φ(x,u) 是状态-动作对的可解释特征向量。
- 定义一个概率模型 P(a|θ,q),表示在真实奖励 θ 下,人类对包含两条轨迹和一个特征的查询 q 的回答分布。
- 系统主动选择能最大化关于 θ 的后验分布信息增益的查询,采用基于不确定性的采集函数。
- 利用比较和特征查询的联合证据,对 θ 进行贝叶斯推理,迭代更新信念。
- 在模拟环境中对完美和噪声人类响应进行评估,并在实验室真实用户研究中验证了驾驶风格偏好的适用性。
实验结果
研究问题
- RQ1结合比较与特征解释(即说明哪一特征导致偏好)的丰富查询,是否能比仅使用比较的查询实现更快、更准确的奖励学习?
- RQ2将特征回答整合进统一的概率模型中,如何提升机器人推断真实用户偏好的能力?
- RQ3基于丰富查询信息增益的主动查询选择策略,是否在收敛速度和准确性上优于随机或非自适应的查询策略?
- RQ4真实用户在使用特征丰富查询时,对其可用性、透明度和信任感有何感受?
- RQ5通过丰富查询训练出的机器人,其行为在多大程度上比仅通过比较学习训练的机器人更受用户青睐?
主要发现
- 在模拟实验中,丰富查询在学习正确奖励参数方面始终优于仅使用比较的查询,无论在完美还是噪声人类响应下,均表现出更快的收敛速度和更高的准确性。
- 在真实用户研究中,使用丰富查询学习到的奖励函数优化出的轨迹,有 74% 的时间被用户更偏好,优于仅使用比较学习的轨迹。
- 用户在所有四项李克特量表偏好问题上,对使用丰富查询训练的机器人评分显著更高(所有 p < .001),包括匹配其预期和愿意乘坐该车的意愿。
- 参与者表示特征查询非常有用(平均评分 5.8/7),显著提升了他们比较轨迹的能力(平均 5.9/7),并增强了透明度(平均 6.3/7),尽管增加了认知负担。
- 特征查询的平均用户体验评分为 6.0/7,所有参与者均表示愿意额外付出努力来帮助机器人学习更优偏好,即使需要更多精力。
- 研究证实,更丰富的查询能带来更可信、更高效、更易理解的机器人行为,这是终端用户的真实感知。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。