Skip to main content
QUICK REVIEW

[论文解读] Divide-and-Conquer Reinforcement Learning

Dibya Ghosh, Avi Singh|arXiv (Cornell University)|Nov 27, 2017
Reinforcement Learning in Robotics参考文献 15被引用 13
一句话总结

该论文提出了一种分治强化学习(DnC)方法,该方法将初始状态空间划分为不同的片段,为每个片段独立训练策略,并通过KL散度约束和蒸馏技术逐步将这些策略统一为单一全局策略。DnC在初始状态和目标高度可变的复杂机器人操作与运动任务中,显著优于标准策略梯度方法和基于集成的方法。

ABSTRACT

Standard model-free deep reinforcement learning (RL) algorithms sample a new initial state for each trial, allowing them to optimize policies that can perform well even in highly stochastic environments. However, problems that exhibit considerable initial state variation typically produce high-variance gradient estimates for model-free RL, making direct policy or value function optimization challenging. In this paper, we develop a novel algorithm that instead partitions the initial state space into "slices", and optimizes an ensemble of policies, each on a different slice. The ensemble is gradually unified into a single policy that can succeed on the whole state space. This approach, which we term divide-and-conquer RL, is able to solve complex tasks where conventional deep RL methods are ineffective. Our results show that divide-and-conquer RL greatly outperforms conventional policy gradient methods on challenging grasping, manipulation, and locomotion tasks, and exceeds the performance of a variety of prior methods. Videos of policies learned by our algorithm can be viewed at http://bit.ly/dnc-rl

研究动机与目标

  • 为解决由高度随机的初始状态和目标分布引起的深度强化学习中梯度估计方差过高的问题。
  • 在标准策略梯度方法因初始条件多样性而失效的复杂机器人任务(尤其是操作与运动任务)中实现有效学习。
  • 开发一种方法,为不同状态空间片段学习专用策略,并将其统一为一个稳健的全局策略。
  • 在动态丰富且高度可变的环境中降低样本复杂度并提升学习稳定性。
  • 通过直接在低层级力矩控制空间中训练,消除对示范数据或高层动作空间的依赖。

提出的方法

  • 该算法根据状态分布特性,将初始状态空间划分为多个非重叠的“片段”。
  • 使用标准深度强化学习方法,为每个片段独立训练策略,从而在每个局部区域内实现更低方差的梯度估计。
  • 通过相互KL散度约束,逐步将各策略统一为单一全局策略,以促进不同片段间策略的一致性。
  • 在策略之间应用监督蒸馏,以传递知识并加速收敛,尤其对学习缓慢的策略效果显著。
  • 最终的全局策略经过训练,能够在所有片段上泛化,实现在整个状态空间内行为的一致性。
  • 该方法采用集中式训练、分布式推理的设置,在统一训练过程中各片段共享策略参数。

实验结果

研究问题

  • RQ1将初始状态空间划分为离散片段,是否能提升高方差强化学习任务中的学习稳定性和样本效率?
  • RQ2在完整分布上进行端到端训练与在局部状态空间区域分别训练策略相比,在最终性能和收敛速度方面有何差异?
  • RQ3相互KL约束与蒸馏在多大程度上能有效将多个专用策略统一为一个通用策略?
  • RQ4DnC是否在初始状态和目标高度可变的任务中,优于标准策略梯度方法和先前的集成方法?
  • RQ5DnC是否能在无示范数据或高层动作抽象的情况下,在低层级力矩控制空间中学习到有效的策略?

主要发现

  • DnC在所有评估任务中均取得了最高的最终平均回报,优于TRPO、SAC及其他基线方法。
  • 在Ant Position运动任务中,DnC仅需约TRPO所需样本量的1/10(即4000万样本)便解决了任务,而TRPO需4亿样本。
  • 在Stairs运动任务中,DnC学习到了既不同又协调的步态——短楼梯时采用跨步步态,高楼梯时采用跳跃步态,且在所有高度上均保持了高性能。
  • DnC学习到的策略比基线方法更具鲁棒性和泛化能力,避免了如跳跃步态在短楼梯上失效等脆弱行为。
  • 集中式DnC变体在所有任务中均取得了最佳性能,表明引入跨策略约束的统一训练具有显著有效性。
  • 在抓取和接住等操作任务中,DnC显著超越了先前方法的性能,尤其在高变异性的设置下表现突出。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。