[论文解读] SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning
SURF 提出了一种半监督奖励学习框架,通过利用未标注的示范数据和一种新颖的时间裁剪数据增强技术,在基于偏好强化学习中提升了反馈效率。该方法仅使用几百次偏好查询,便在复杂机器人操作任务中实现了接近最优的性能,显著优于低反馈设置下的基线方法。
Preference-based reinforcement learning (RL) has shown potential for teaching agents to perform the target tasks without a costly, pre-defined reward function by learning the reward with a supervisor's preference between the two agent behaviors. However, preference-based learning often requires a large amount of human feedback, making it difficult to apply this approach to various applications. This data-efficiency problem, on the other hand, has been typically addressed by using unlabeled samples or data augmentation techniques in the context of supervised learning. Motivated by the recent success of these approaches, we present SURF, a semi-supervised reward learning framework that utilizes a large amount of unlabeled samples with data augmentation. In order to leverage unlabeled samples for reward learning, we infer pseudo-labels of the unlabeled samples based on the confidence of the preference predictor. To further improve the label-efficiency of reward learning, we introduce a new data augmentation that temporally crops consecutive subsequences from the original behaviors. Our experiments demonstrate that our approach significantly improves the feedback-efficiency of the state-of-the-art preference-based method on a variety of locomotion and robotic manipulation tasks.
研究动机与目标
- 解决基于偏好强化学习中人工反馈成本过高的问题,该问题限制了其在复杂任务中的应用。
- 利用存储在回放缓冲区中的无限未标注示范数据,提升样本效率。
- 通过一种新型数据增强方法(从智能体轨迹中裁剪连续子序列)强制一致性,以改善奖励泛化能力。
- 实现对高维、部分可观察输入(如像素观测)的有效学习。
提出的方法
- 使用伪标签法,基于训练好的偏好预测器的置信度,为未标注示范生成人工偏好标签。
- 引入时间裁剪增强技术,从完整轨迹中生成轻微偏移或缩放的子序列,假设其偏好保持不变。
- 使用带加权损失目标的联合有标签偏好数据与伪标签未标注数据,训练奖励模型。
- 通过最小化不同增强视图之间的奖励预测差异,强制原始视图与增强视图之间的一致性。
- 将该框架端到端地集成到基于偏好的强化学习流程中,与现有方法(如 PEBBLE)兼容。
- 调整超参数,包括未标注批次比例、伪标签的置信度阈值,以及监督与自监督目标之间的损失权重。
实验结果
研究问题
- RQ1能否有效利用回放缓冲区中的未标注示范数据,以提升基于偏好强化学习的反馈效率?
- RQ2新颖的时间裁剪数据增强策略是否能提升奖励泛化能力并减少所需的人工偏好查询次数?
- RQ3半监督学习与数据增强的结合在高维、部分可观察控制任务中的表现如何?
- RQ4SURF 在多大程度上能减少复杂机器人操作与运动控制任务中实现高性能所需的反馈预算?
主要发现
- 在 Meta-World 的复杂机器人操作任务中,SURF 仅使用 200 次偏好查询即实现了约 100% 的成功率,而基线方法在相同条件下仅达到约 50% 的成功率。
- 在基于像素观测的运动控制任务中,SURF 仅用 200 次偏好查询,即达到了强基线方法(DrQ-v2 搭配真实奖励)的性能水平。
- 该方法对未标注批次比例和置信度阈值的变化具有鲁棒性,但当批次过大或阈值过低时性能略有下降。
- 损失权重 λ 的超参数调优带来了最显著的性能提升,表明其在平衡监督与自监督学习中起着关键作用。
- SURF 在 DeepMind Control Suite 和 Meta-World 的多样化任务中均提升了反馈效率,证明其泛化能力超越特定环境。
- 该框架兼容基于图像的输入,可与现有图像增强技术结合,暗示未来性能仍有进一步提升的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。