[论文解读] Offline Learning from Demonstrations and Unlabeled Experience
本文提出离线强化模仿学习(ORIL),一种利用专家演示和未标注机器人经验(无需奖励标注)进行离线强化学习训练高性能策略的方法。通过首先利用专家数据与未标注数据之间的对比学习来学习奖励函数,然后使用学习到的奖励重新标注所有数据,ORIL 在有限演示数据和越来越多低质量未标注数据的情况下,始终优于行为克隆(BC)。
Behavior cloning (BC) is often practical for robot learning because it allows a policy to be trained offline without rewards, by supervised learning on expert demonstrations. However, BC does not effectively leverage what we will refer to as unlabeled experience: data of mixed and unknown quality without reward annotations. This unlabeled data can be generated by a variety of sources such as human teleoperation, scripted policies and other agents on the same robot. Towards data-driven offline robot learning that can use this unlabeled experience, we introduce Offline Reinforced Imitation Learning (ORIL). ORIL first learns a reward function by contrasting observations from demonstrator and unlabeled trajectories, then annotates all data with the learned reward, and finally trains an agent via offline reinforcement learning. Across a diverse set of continuous control and simulated robotic manipulation tasks, we show that ORIL consistently outperforms comparable BC agents by effectively leveraging unlabeled experience.
研究动机与目标
- 解决在仅有专家演示和未标注、无奖励标注经验的情况下,离线机器人学习中的样本效率挑战。
- 在无需在线环境交互的前提下,实现从混合质量的未标注数据(包括次优和无关任务轨迹)中有效学习策略。
- 通过利用未标注数据同时训练奖励模型和最终策略,结合行为克隆与离线强化学习的优势。
- 通过使学习过程对低质量或多样化的未标注数据具有鲁棒性,减少对高质量演示的依赖。
- 开发一种可扩展、数据驱动的方法,在演示数据稀缺时仍能实现良好泛化。
提出的方法
- 使用对比损失训练奖励函数 $ R_{\psi}(s_t) $,通过区分专家状态与未标注状态,最小化从 $ \mathcal{D}_E $ 和 $ \mathcal{D}_U $ 中采样的状态的交叉熵损失。
- 采用正样本-未标注样本(PU)学习方法,通过重加权损失缓解假阴性问题,提升当未标注数据中包含隐藏成功轨迹时的鲁棒性。
- 使用任务相关对抗模仿学习(TRAIL)聚焦奖励模型于任务相关状态,增强泛化能力和性能。
- 使用学习到的奖励函数对所有轨迹(包括演示和未标注轨迹)进行标注,构建统一的、带奖励标注的数据集。
- 使用先进的离线强化学习算法(如 CRR)在完全标注的数据集上执行离线强化学习,实现在无需在线轨迹采样的情况下进行策略优化。
- 整合对抗模仿学习、PU学习和现代离线强化学习的组件,构建一种可扩展、端到端的高效离线策略学习方法。
实验结果
研究问题
- RQ1当无任何奖励信号时,能否有效利用来自多样化来源、质量混合的未标注机器人经验,以提升离线策略学习性能?
- RQ2通过在专家数据和未标注数据上进行对比学习训练的奖励模型,是否具备足够的泛化能力,使策略学习性能优于标准行为克隆?
- RQ3当专家演示有限时,ORIL 的性能如何随未标注数据量的增加而变化?
- RQ4ORIL 是否能在训练过程中完全离线且无奖励信号的前提下,实现与使用真实奖励信号的最先进方法相当的性能?
- RQ5PU学习和TRAIL在奖励学习阶段对缓解假阴性和低质量未标注数据的鲁棒性提升程度如何?
主要发现
- ORIL 在多种连续控制和机器人操作任务中始终优于行为克隆(BC),即使 BC 使用相同数量的演示数据。
- ORIL 的性能随着未标注数据量的增加而单调提升,表明其具备良好的可扩展性和高效的数据利用能力。
- 即使未标注数据的平均质量较低,ORIL 仍能保持强劲性能,表明其对噪声或次优轨迹具有鲁棒性。
- 仅使用 10 个演示时,ORIL 的性能即可媲美使用更大演示数据集训练的 BC,展现出卓越的样本效率。
- 在足够多未标注数据可用时,ORIL 在 Jaco 机械臂的 Insertion 任务中达到专家水平性能,而 BC 在相同条件下无法达到专家性能。
- 该方法在任务间泛化良好,即使演示数据集规模减少至仅 3–5 个轨迹,仍能保持一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。