[论文解读] Dynamic Experience Replay
本论文提出动态经验回放(DER),一种通过在训练过程中动态整合强化学习智能体生成的成功转移轨迹,同时结合人类示范,以增强离策略强化学习的技术。DER 显著提升了样本效率和训练速度,使复杂机器人装配任务(如插销入孔和搭接接头)的学习成为可能,而原始的 Ape-X DDPG 方法则无法成功训练或训练速度极慢。
We present a novel technique called Dynamic Experience Replay (DER) that allows Reinforcement Learning (RL) algorithms to use experience replay samples not only from human demonstrations but also successful transitions generated by RL agents during training and therefore improve training efficiency. It can be combined with an arbitrary off-policy RL algorithm, such as DDPG or DQN, and their distributed versions. We build upon Ape-X DDPG and demonstrate our approach on robotic tight-fitting joint assembly tasks, based on force/torque and Cartesian pose observations. In particular, we run experiments on two different tasks: peg-in-hole and lap-joint. In each case, we compare different replay buffer structures and how DER affects them. Our ablation studies show that Dynamic Experience Replay is a crucial ingredient that either largely shortens the training time in these challenging environments or solves the tasks that the vanilla Ape-X DDPG cannot solve. We also show that our policies learned purely in simulation can be deployed successfully on the real robot. The video presenting our experiments is available at https://sites.google.com/site/dynamicexperiencereplay
研究动机与目标
- 解决在涉及接触力的高精度机器人装配任务中,无模型强化学习的数据效率低下问题。
- 在人类示范稀疏或不足的复杂、接触丰富的环境中,提升训练效率。
- 通过在训练过程中动态重用成功轨迹,超越静态人类示范,实现样本高效的训练。
- 证明在纯仿真环境中训练的策略可成功部署到真实世界机器人硬件上。
- 评估 DER 在不同经验回放缓冲区配置和任务复杂度下的影响。
提出的方法
- 提出动态经验回放(DER)方法,将训练过程中智能体生成的成功转移轨迹动态加入经验回放缓冲区。
- 将 DER 与 Ape-X DDPG(一种离策略深度强化学习算法)结合,实现具有优先经验回放的可扩展、分布式训练。
- 采用动态采样策略,对回放缓冲区中代表性不足的成功转移轨迹进行过采样,以解决类别不平衡问题,类似于监督学习中的数据增强。
- 将力/力矩和笛卡尔位姿观测作为状态输入,并输出 6-DOF 笛卡尔速度,以绕过不准确的机器人动力学模型。
- 维持一个固定大小(200 万条转移)的回放缓冲区,其中 1%(2 万条)用于人类示范,其余用于智能体生成的转移。
- 使用优先经验回放(alpha = 0.5),并通过截断的回合采样策略稳定学习过程。
实验结果
研究问题
- RQ1在人类示范有限的接触丰富型机器人装配任务中,DER 是否能提升训练效率?
- RQ2与原始的 Ape-X DDPG 相比,DER 在插销入孔和搭接接头任务中的收敛速度和最终成功率如何?
- RQ3DER 是否能使原本对标准离策略强化学习算法不可行的任务得以学习?
- RQ4使用 DER 在仿真环境中训练的策略是否可成功部署到真实工业机器人上?
- RQ5不同经验回放缓冲区配置(如无人类示范、所有样本均匀分配至所有缓冲区)如何影响 DER 的性能?
主要发现
- 在具有挑战性的机器人装配任务中,DER 显著减少了训练时间,某一配置下成功时间仅为原始 Ape-X DDPG 的一半。
- 在无人类示范设置下,DER 达到了与原始 Ape-X DDPG 相同的成功率,但训练速度接近两倍,证明了其样本效率的提升。
- 对于具有更严格公差(1 毫米)且无倒角边缘的搭接接头任务,DER 在四种缓冲区配置中的两种中,优于原始 Ape-X DDPG。
- 使用 DER 在仿真中训练的策略在 KUKA KR60 工业机器人臂上,对搭接接头任务在 3 次试验中全部成功部署。
- 在每个缓冲区仅取一条示范的配置中,DER 并未提升性能,表明其对缓冲区结构和采样策略具有敏感性。
- DER 使原本在给定训练时间内无法被基线 Ape-X DDPG 解决的高精度装配任务得以成功学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。