[论文解读] Automatic Parameter Optimization Using Genetic Algorithm in Deep Reinforcement Learning for Robotic Manipulation Tasks
本文提出了一种基于遗传算法(GA)的新型超参数优化框架,用于机器人操作任务中的深度确定性策略梯度与事后经验回放(DDPG+HER)。通过自动调整学习率、探索噪声和目标网络更新率等关键超参数,GA+DDPG+HER方法将学习时间最多减少57%,并在六个仿真环境和一个真实世界机器人任务中显著提升了样本效率,所有对比实验中均优于基线方法。
Learning agents can make use of Reinforcement Learning (RL) to decide their actions by using a reward function. However, the learning process is greatly influenced by the elect of values of the hyperparameters used in the learning algorithm. This work proposed a Deep Deterministic Policy Gradient (DDPG) and Hindsight Experience Replay (HER) based method, which makes use of the Genetic Algorithm (GA) to fine-tune the hyperparameters' values. This method (GA+DDPG+HER) experimented on six robotic manipulation tasks: FetchReach; FetchSlide; FetchPush; FetchPickAndPlace; DoorOpening; and AuboReach. Analysis of these results demonstrated a significant increase in performance and a decrease in learning time. Also, we compare and provide evidence that GA+DDPG+HER is better than the existing methods.
研究动机与目标
- 为解决深度强化学习(DRL)在机器人操作中因超参数敏感性带来的关键挑战,其中次优设置会显著减慢学习速度。
- 开发一种自动化、可复用的超参数调优方法,以减少对人工或启发式调优的依赖。
- 评估遗传算法(GA)在多样化机器人任务中优化DDPG+HER超参数的有效性。
- 将GA+DDPG+HER与现有方法进行对比,证明其在仿真和真实世界环境中均具有一致的性能提升。
- 提供开源代码,并在标准OpenAI Gym环境和自建的Aubo-i5机器人操作任务上验证该方法。
提出的方法
- 采用遗传算法(GA)搜索DDPG+HER的超参数空间,将每个解编码为包含二进制编码超参数的染色体。
- GA使用排序选择进行父代选择,使用均匀交叉生成子代,使用翻转突变以保持多样性。
- 通过在任务上训练DDPG+HER智能体并测量达到85%成功率所需训练轮次数,评估每个染色体的适应度。
- 该算法通过多代迭代演化种群,优先选择能最小化训练时间的超参数组合。
- 优化的超参数包括折扣因子(γ)、Polyak平均系数(τ)、智能体和评论家学习率、探索率(ϵ)以及动作噪声标准差(η)。
- 该方法在六个仿真环境(FetchReach、FetchSlide等)和一个真实世界的Aubo-i5机器人环境中进行测试,性能在十轮独立训练中进行评估。
实验结果
研究问题
- RQ1遗传算法能否有效优化DDPG+HER的超参数,以加速机器人操作任务中的学习?
- RQ2与基线超参数设置及其他优化方法相比,GA+DDPG+HER在学习速度和性能方面表现如何?
- RQ3自动化超参数调优在多大程度上减少了达到目标成功率所需的训练轮次数?
- RQ4优化后的超参数设置是否能在包括仿真和真实世界环境在内的多样化机器人操作任务中实现泛化?
- RQ5基于GA的调优过程是否具有可复用性且计算高效,适用于未来的DRL训练会话?
主要发现
- 与默认超参数相比,GA+DDPG+HER方法将达到85%成功率所需的训练轮次数最多减少了57%。
- 在FetchReach-v1环境中,该方法始终优于其他四种方法,表现出更优的样本效率和更快的收敛速度。
- 智能体的成功率对超参数值高度敏感,尤其是Polyak平均系数τ,不同设置下观察到非线性的性能变化。
- 在使用稀疏奖励时,结合优化超参数的Hindsight Experience Replay(HER)能实现有效学习,显著优于稀疏奖励函数的形状设计。
- GA优化的超参数在六个仿真机器人任务和一个使用Aubo-i5机器人的真实世界机器人操作任务中均具有可迁移性和有效性。
- 该方法表现出鲁棒性和稳定性,使用GA优化的超参数在十轮独立训练中均保持一致的性能表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。