[论文解读] Lifelong Robotic Reinforcement Learning by Retaining Experiences
该论文提出了一种用于物理机器人的终身强化学习框架,通过保留并选择性重用先前经验来提高数据效率。通过在重标注的过往经验上进行预训练,并基于动态相似性进行选择性回放微调,该方法相比从零开始学习每个任务,将样本需求减少了50%以上,在10项操作任务中实现了2倍的学习效率提升,实验对象为真实的Franka Panda机器人。
Multi-task learning ideally allows robots to acquire a diverse repertoire of useful skills. However, many multi-task reinforcement learning efforts assume the robot can collect data from all tasks at all times. In reality, the tasks that the robot learns arrive sequentially, depending on the user and the robot's current environment. In this work, we study a practical sequential multi-task RL problem that is motivated by the practical constraints of physical robotic systems, and derive an approach that effectively leverages the data and policies learned for previous tasks to cumulatively grow the robot's skill-set. In a series of simulated robotic manipulation experiments, our approach requires less than half the samples than learning each task from scratch, while avoiding impractical round-robin data collection. On a Franka Emika Panda robot arm, our approach incrementally learns ten challenging tasks, including bottle capping and block insertion.
研究动机与目标
- 为解决物理机器人中轮转式多任务强化学习的实际局限,即无法同时关注多个任务。
- 通过利用先前收集的经验来加速新任务的学习,实现高效终身学习。
- 在促进正向迁移的同时,通过结构化重用过往经验来缓解灾难性遗忘。
- 开发一种可扩展、数据高效的框架,适用于目标和物理设置各异的真实世界机器人操作任务。
提出的方法
- 该方法在每个新任务上执行两个阶段:在回放缓冲区中重用先前经验进行预训练,以及基于选择性回放进行在线微调。
- 在预训练前,使用当前任务的奖励函数对先前经验进行重标注,使其与新目标对齐。
- 根据样本与当前任务动态的相似性,对来自先前任务的经验进行过滤,以纠正样本选择偏差。
- 算法使用过去转移与当前任务动态之间的相似性度量,优先选择最相关经验用于迁移。
- 该方法结合经验回放与策略网络权重迁移,同时提升了稳定性与样本效率。
- 该框架假设可完整记忆过往经验,专注于正向迁移,避免了不切实际的轮转式数据收集。
实验结果
研究问题
- RQ1在终身学习设置中,是否可以有效重用先前已解决任务的经验,以加速新任务的学习?
- RQ2当从具有不同动态和奖励的多样化任务中迁移经验时,如何缓解样本选择偏差?
- RQ3基于与当前任务动态相似性的选择性回放,是否相比标准经验回放能提升数据效率与学习稳定性?
- RQ4在物理机器人终身强化学习中,基于经验的迁移在多大程度上可与基于权重的迁移互补?
- RQ5该框架是否能在无需轮转式数据收集的情况下,在真实世界机器人操作任务中实现显著的样本效率提升?
主要发现
- 在真实的Franka Emika Panda机器人上,该方法在10,000次环境交互步内平均到达目标距离为0.75厘米,而从零开始学习时为1.83厘米。
- 该方法将学习十项具有挑战性的操作任务所需的环境交互步数减少至100,000以下,相比从零开始学习实现了2倍的效率提升。
- 基于动态相似性的过往经验过滤显著提升了学习效率,而标准经验回放则导致次优策略。
- 消融实验表明,对重标注数据进行预训练和选择性在线回放均为性能的关键组成部分,二者对样本效率的贡献各具独特性。
- 通过利用重标注的过往数据,该方法减少了无关探索步数,从而加速了向任务目标的收敛。
- 该框架在多样化任务中表现出一致的正向迁移,包括瓶盖封合、积木插入和阀门旋转等任务,在仿真和真实世界实验中均展现出稳定且高效的学习曲线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。