Skip to main content
QUICK REVIEW

[论文解读] PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training

Kimin Lee, Laura Smith|arXiv (Cornell University)|Jun 9, 2021
Reinforcement Learning in Robotics参考文献 76被引用 13
一句话总结

PEBBLE 提出了一种反馈高效的交互式强化学习框架,通过结合自监督预训练与基于经验重标注的离策略学习,显著减少了人类反馈和样本需求。通过预训练使智能体能够探索多样化的行为,并在奖励模型更新时重标注过往经验,PEBBLE 实现了与使用稀疏奖励的监督式强化学习相当的性能,仅需极少的人类偏好反馈即可完成复杂运动与操作任务。

ABSTRACT

Conveying complex objectives to reinforcement learning (RL) agents can often be difficult, involving meticulous design of reward functions that are sufficiently informative yet easy enough to provide. Human-in-the-loop RL methods allow practitioners to instead interactively teach agents through tailored feedback; however, such approaches have been challenging to scale since human feedback is very expensive. In this work, we aim to make this process more sample- and feedback-efficient. We present an off-policy, interactive RL algorithm that capitalizes on the strengths of both feedback and off-policy learning. Specifically, we learn a reward model by actively querying a teacher's preferences between two clips of behavior and use it to train an agent. To enable off-policy learning, we relabel all the agent's past experience when its reward model changes. We additionally show that pre-training our agents with unsupervised exploration substantially increases the mileage of its queries. We demonstrate that our approach is capable of learning tasks of higher complexity than previously considered by human-in-the-loop methods, including a variety of locomotion and robotic manipulation skills. We also show that our method is able to utilize real-time human feedback to effectively prevent reward exploitation and learn new behaviors that are difficult to specify with standard reward functions.

研究动机与目标

  • 通过提升反馈效率与样本效率,降低交互式强化学习中人类反馈的高昂成本。
  • 仅使用少量人类偏好比较,实现对复杂机器人行为(如运动与操作)的学习。
  • 通过引入人类在环的纠错机制,缓解奖励利用问题,纠正意外行为。
  • 结合自监督预训练与离策略学习,最大化已收集经验的复用率,减少对实时人类输入的依赖。

提出的方法

  • 智能体首先通过内在好奇心进行自监督预训练,以探索多样化状态并生成连贯多样的行为。
  • 人类反馈以两段智能体行为片段之间的二元偏好形式收集,用于训练奖励模型。
  • 在每次奖励模型更新后,对所有过往经验进行重标注,实现离策略学习,最大化数据效率。
  • 使用离策略强化学习(如 SAC)更新策略,以在学习到的奖励模型下最大化期望回报。
  • 采用基于不确定性的采样方法(如分歧度或熵)选择具有信息量的行为片段用于人类反馈,提升学习效率。
  • 该方法应用于 MuJoCo 中的连续控制任务,包括 Walker、Cheetah、Quadruped、Hopper 和 CartPole,并使用真实世界的人类反馈。

实验结果

研究问题

  • RQ1自监督预训练能否提升交互式强化学习中人类反馈的质量与信息量?
  • RQ2结合经验重标注的离策略学习能否显著减少所需的人类反馈查询次数?
  • RQ3PEBBLE 能否学习到复杂机器人行为(如后空翻或腿部摆动)——这些行为难以通过工程化奖励函数指定?
  • RQ4与使用手工设计奖励的标准强化学习相比,PEBBLE 是否能有效防止奖励利用,并生成更自然、更符合人类偏好的行为?

主要发现

  • 尽管仅使用 1400 次反馈查询,PEBBLE 在所有任务上(包括 Quadruped-walk 和 Hopper-backflip)的性能均与使用真实稀疏奖励的 SAC 相当。
  • 在 Quadruped-walk 任务中,PEBBLE 在相同反馈查询数量下优于 Preference PPO,证明了其更高的反馈效率。
  • 对较长行为片段(如 10 步片段)的人类反馈提供了更有意义的监督,相比逐步反馈,能实现更快且更稳定的训练。
  • 自监督预训练显著提升了最终性能与样本效率,因为它使教师能够就多样化且连贯的行为提供更具信息量的反馈。
  • PEBBLE 仅使用 50–200 次人类查询,成功引导智能体学习到新型行为,如杆子摆动、前腿摆动与后空翻。
  • 在 Walker 环境中,PEBBLE 通过 200 次人类反馈查询纠正了奖励利用问题——即 SAC 学会仅用一条腿行走——成功引导智能体采用更自然的双足步态。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。