[论文解读] Learning a Universal Human Prior for Dexterous Manipulation from Human Preference
该论文提出了一种基于人类反馈的强化学习(RLHF)框架,通过人类对机器人轨迹视频的偏好判断,学习一种适用于灵巧操作的通用人类先验。通过迭代生成多样化策略、收集人类偏好并训练一个与任务无关的奖励模型,该方法在20个模拟灵巧操作任务中提升了策略的自然度与任务表现——在四轮微调迭代后,偏好概率相比原始策略提升了22.3%,并实现了对未见任务的泛化能力以及从仿真到现实的迁移。
Generating human-like behavior on robots is a great challenge especially in dexterous manipulation tasks with robotic hands. Scripting policies from scratch is intractable due to the high-dimensional control space, and training policies with reinforcement learning (RL) and manual reward engineering can also be hard and lead to unnatural motions. Leveraging the recent progress on RL from Human Feedback, we propose a framework that learns a universal human prior using direct human preference feedback over videos, for efficiently tuning the RL policies on 20 dual-hand robot manipulation tasks in simulation, without a single human demonstration. A task-agnostic reward model is trained through iteratively generating diverse polices and collecting human preference over the trajectories; it is then applied for regularizing the behavior of polices in the fine-tuning stage. Our method empirically demonstrates more human-like behaviors on robot hands in diverse tasks including even unseen tasks, indicating its generalization capability.
研究动机与目标
- 为解决训练灵巧操作策略时出现的非自然或突兀行为问题,提升其类人自然运动能力,避免标准强化学习训练中常见的不自然行为。
- 减少对昂贵人类演示或人工奖励工程的依赖,利用人类偏好反馈作为人类行为规范的可扩展代理。
- 学习一个单一的、与任务无关的奖励模型,使其能在多种灵巧操作任务中泛化,包括未见过的任务。
- 仅使用偏好信号,无需演示,实现模拟环境中的高效策略微调及从仿真到现实的迁移。
- 探究人类偏好反馈是否能有效正则化策略,使其趋向于能量高效、关节安全且符合人类行为规范的行为。
提出的方法
- 一种迭代式流程在20个灵巧操作任务中交替进行:生成多样化策略,收集人类对轨迹视频的偏好标签,并基于标注反馈训练一个与任务无关的奖励模型(RM)。
- 奖励模型采用偏好学习目标进行训练,通过比较成对轨迹,学习预测哪种运动更符合人类行为特征。
- 策略通过结合任务特定奖励(如成功信号)与来自RM的人类偏好奖励的混合目标进行微调,采用自适应缩放以平衡两种信号。
- 方法在策略微调过程中使用PPO并引入熵奖励,以促进探索,同时由RM引导行为向人类行为规范靠拢。
- 专门构建了一个平台,用于收集人类对机器人运动视频的偏好反馈,确保在各类任务中实现多样化且高质量的标注。
- 最终的RM被应用于已知和未见任务的策略微调,实现零样本泛化及从仿真到现实的迁移。
实验结果
研究问题
- RQ1在无需演示的情况下,基于视频轨迹的人类偏好反馈能否有效学习到灵巧操作的通用人类先验?
- RQ2一个单一的、与任务无关的奖励模型在未见灵巧操作任务上的泛化能力如何?
- RQ3使用人类偏好奖励模型对策略进行微调,是否能同时提升任务表现与运动的类人程度?
- RQ4哪些超参数选择(如缩放系数)显著影响策略微调中任务成功与类人程度之间的平衡?
- RQ5在哪些任务中,RM无法有效引导策略向类人行为靠拢?原因是什么?
主要发现
- 经过四轮微调迭代,该方法在偏好概率上相比原始强化学习策略提升了22.3%,充分证明了其在学习类人行为方面的有效性。
- 与任务无关的奖励模型成功泛化至未见的灵巧操作任务,在偏好得分和任务成功率上均实现提升。
- 成功实现了从仿真到现实的迁移,表明该方法具备鲁棒性与在真实机器人系统中实际部署的潜力。
- 使用混合目标(公式3)平衡任务奖励与人类偏好奖励,相比标准RLHF目标(公式14)表现更优,后者虽偏好得分更高但任务完成率下降。
- 通过系数 $ c $ 自适应缩放人类偏好奖励,并合理选择 $ \alpha $,显著提升了任务成功率,表明超参数调优具有显著影响。
- 在Kettle和DoorCloseOutward等高难度任务中,RM无法弥补探索能力不足的问题;在SwingCup任务中,初始多样化策略缺乏类人行为,导致学习困难,凸显了任务特定的局限性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。