Skip to main content
QUICK REVIEW

[论文解读] Skill Preferences: Learning to Extract and Execute Robotic Skills from Human Feedback

Xiaofei Wang, Kimin Lee|arXiv (Cornell University)|Aug 11, 2021
Reinforcement Learning in Robotics参考文献 36被引用 7
一句话总结

SkiP 是一种强化学习框架,在技能提取和执行两个阶段均利用人类反馈,从噪声大、次优的离线演示数据中学习与人类对齐的结构化技能。通过建模人类对轨迹的偏好,SkiP 提取了鲁棒的行为先验,显著优于先前的技能提取方法和人机协同强化学习方法,在模拟环境中的复杂多步机器人操作任务中表现更优。

ABSTRACT

A promising approach to solving challenging long-horizon tasks has been to extract behavior priors (skills) by fitting generative models to large offline datasets of demonstrations. However, such generative models inherit the biases of the underlying data and result in poor and unusable skills when trained on imperfect demonstration data. To better align skill extraction with human intent we present Skill Preferences (SkiP), an algorithm that learns a model over human preferences and uses it to extract human-aligned skills from offline data. After extracting human-preferred skills, SkiP also utilizes human feedback to solve down-stream tasks with RL. We show that SkiP enables a simulated kitchen robot to solve complex multi-step manipulation tasks and substantially outperforms prior leading RL algorithms with human preferences as well as leading skill extraction algorithms without human preferences.

研究动机与目标

  • 解决现有技能提取方法依赖于精心筛选的专家级演示数据的局限性,而这类数据在真实场景中很少见。
  • 通过引入人类反馈来去噪并使行为先验与人类意图对齐,克服在不完美或次优离线数据上训练的生成模型的脆弱性。
  • 通过在技能发现过程中使用人类反馈,而非仅用于策略微调,将人机协同强化学习扩展到长时程、组合式任务。
  • 通过在技能提取阶段对轨迹偏好建模,实现从多模态、噪声数据中高效且鲁棒地学习技能。
  • 证明在数据次优时,技能提取阶段的人类反馈对于在复杂下游任务中实现高性能至关重要。

提出的方法

  • 使用演示之间的成对比较,在离线数据集中学习人类对轨迹的偏好模型。
  • 利用学习到的偏好模型在技能提取过程中重新加权轨迹的可能性,优先选择与人类意图一致的轨迹。
  • 在偏好加权的数据集上训练生成模型(如 VAE 或自回归模型),以提取结构化且受人类偏好的技能。
  • 将在下游强化学习循环中将提取的技能作为行为先验,利用人类反馈对策略进行微调以完成特定任务。
  • 在强化学习微调过程中使用基于偏好的奖励信号,引导策略优化朝向人类偏好的行为。
  • 将技能提取与反馈、技能执行与反馈两个阶段整合到统一流程中,提升样本效率和任务性能。

实验结果

研究问题

  • RQ1在噪声大、次优的离线数据上训练时,技能提取阶段的人类反馈是否能提升行为先验的质量?
  • RQ2与无反馈的标准技能提取相比,技能提取阶段引入偏好是否能带来更好的下游任务性能?
  • RQ3与稀疏二值反馈(如子任务完成情况)相比,基于偏好的反馈在样本效率和最终性能方面表现如何?
  • RQ4在需要组合推理的复杂、长时程操作任务中,结合人类反馈的技能提取是否具有泛化能力?
  • RQ5是否可以通过在技能学习阶段使用人类反馈替代人工数据集筛选,从而减少对精心筛选专家演示的依赖?

主要发现

  • 在六个模拟厨房环境中,SkiP 在技能提取阶段使用人类反馈的表现优于无反馈版本,后者在所有任务中均未成功完成。
  • 使用人类反馈进行技能提取的方法相比未加权基线方法,展现出更快的学习曲线和更高的最终性能,证明在先验学习阶段进行偏好建模的必要性。
  • 在六个环境中的五个里,SkiP 使用人类偏好进行下游强化学习的表现优于使用学习到的稀疏奖励分类器的方法,表明偏好信号比二值子任务奖励更具信息量。
  • SkiP 在模拟厨房设置中的复杂多步操作任务中,显著优于领先的“人机协同”强化学习算法和最先进的技能提取基线方法。
  • 偏好加权的技能提取过程即使在专家行为与随机行为混合的数据中,也能成功识别并强调高质量、与人类对齐的轨迹,证明对数据噪声具有鲁棒性。
  • 结果验证了在数据不完美时,技能提取阶段的人类反馈不仅有益,更是实现在具有挑战性的长时程任务中实现可靠性能的必要条件。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。