[论文解读] DiGrad: Multi-Task Reinforcement Learning with Shared Actions
本文提出DiGrad,一种用于机器人系统中具有共享动作的连续控制多任务学习的深度强化学习框架。通过利用差分策略梯度和单一共享的演员-评论家网络,DiGrad在训练稳定性与性能方面优于DDPG,尤其在8连杆平面机械臂和27自由度人形机器人等复杂操作器上,实现了更快的收敛速度和更强的跨任务鲁棒性。
Most reinforcement learning algorithms are inefficient for learning multiple tasks in complex robotic systems, where different tasks share a set of actions. In such environments a compound policy may be learnt with shared neural network parameters, which performs multiple tasks concurrently. However such compound policy may get biased towards a task or the gradients from different tasks negate each other, making the learning unstable and sometimes less data efficient. In this paper, we propose a new approach for simultaneous training of multiple tasks sharing a set of common actions in continuous action spaces, which we call as DiGrad (Differential Policy Gradient). The proposed framework is based on differential policy gradients and can accommodate multi-task learning in a single actor-critic network. We also propose a simple heuristic in the differential policy gradient update to further improve the learning. The proposed architecture was tested on 8 link planar manipulator and 27 degrees of freedom(DoF) Humanoid for learning multi-goal reachability tasks for 3 and 2 end effectors respectively. We show that our approach supports efficient multi-task learning in complex robotic systems, outperforming related methods in continuous action spaces.
研究动机与目标
- 解决在连续控制环境中,当多个任务共享共同动作时,多任务深度强化学习出现的训练不稳定与性能下降问题。
- 开发一种统一框架,通过共享参数的单一复合策略,实现多个任务的高效、稳定与鲁棒训练。
- 提升多任务机器人系统中的泛化能力,减少负面梯度干扰,特别是在具有重叠动作空间的分支机械臂中。
- 在8连杆平面机械臂和27自由度人形机器人等复杂机器人系统上,验证DiGrad在多目标可达性任务中的有效性。
提出的方法
- 该框架使用单一共享的演员-评论家网络,同时学习多个确定性策略,每个任务拥有独立的状态-动作值函数。
- 提出一种差分策略梯度更新规则,仅基于对应任务的动作与奖励计算梯度,从而最小化任务间的干扰。
- 对共享动作的梯度应用启发式归一化方法以稳定训练,具体为根据公式(11)对共享动作值的梯度进行归一化。
- 该方法支持单评论家与多评论家架构,实验结果表明单评论家变体性能更优,因其提升了参数共享与相关性学习能力。
- 该框架基于DDPG算法构建,但通过引入任务特定的价值函数更新与差分梯度计算,扩展其以处理多任务动态。
- 实验在机器人系统中采用共享动作空间进行,奖励塑造设计用于反映任务特定的进展,同时避免某一任务主导其他任务。
实验结果
研究问题
- RQ1是否可通过具有差分策略梯度的统一演员-评论家网络,在共享动作的连续控制多任务强化学习中实现训练稳定?
- RQ2在具有重叠动作空间的多个任务中,DiGrad相较于DDPG在收敛速度、最终性能与训练稳定性方面表现如何?
- RQ3对共享动作梯度进行归一化是否能提升多任务深度强化学习中的训练稳定性和性能?
- RQ4在使用共享参数的情况下,单评论家架构是否能优于多评论家设置?
- RQ5DiGrad在多目标机器人控制中,能在多大程度上缓解负面梯度干扰与任务主导现象?
主要发现
- DiGrad在所有测试环境中均优于DDPG,无论在8连杆平面机械臂还是27自由度人形机器人上,均实现了更快的收敛速度与更高的最终平均奖励。
- 单评论家DiGrad框架性能优于多评论家变体,参数更少,且在任务间实现了更优的相关性学习。
- 应用梯度归一化启发式方法显著提升了训练稳定性,尤其在训练初期,且对最终性能影响较小。
- DDPG在多任务设置中表现出不稳定与任务主导现象,尤其在使用累加奖励信号时,归因于负面梯度干扰。
- 在8连杆机械臂上,DiGrad在所有三个任务中均保持一致的性能表现,尽管各任务动作维度不同,而DDPG仅在任务2上达到相当性能。
- 在人形机器人上,单评论家设置下结合启发式方法的DiGrad在稳定性与最终性能方面均表现最佳,且无性能随时间退化现象。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。