[论文解读] Reinforcement Learning with Probabilistically Complete Exploration
本文提出快速随机探索强化学习(R3L),一种利用快速随机树(RRT)规划生成高质量示范用于稀疏奖励强化学习策略初始化的方法。通过在强化学习微调前利用RRT寻找成功轨迹,R3L相较于标准方法和内在探索方法,实现了更快的收敛速度、更低的样本复杂度以及更高的鲁棒性。
Balancing exploration and exploitation remains a key challenge in reinforcement learning (RL). State-of-the-art RL algorithms suffer from high sample complexity, particularly in the sparse reward case, where they can do no better than to explore in all directions until the first positive rewards are found. To mitigate this, we propose Rapidly Randomly-exploring Reinforcement Learning (R3L). We formulate exploration as a search problem and leverage widely-used planning algorithms such as Rapidly-exploring Random Tree (RRT) to find initial solutions. These solutions are used as demonstrations to initialize a policy, then refined by a generic RL algorithm, leading to faster and more stable convergence. We provide theoretical guarantees of R3L exploration finding successful solutions, as well as bounds for its sampling complexity. We experimentally demonstrate the method outperforms classic and intrinsic exploration techniques, requiring only a fraction of exploration samples and achieving better asymptotic performance.
研究动机与目标
- 解决在随机探索效率低下的稀疏奖励环境中强化学习的高样本复杂度问题。
- 减少对随机初始化的依赖,并提升策略梯度方法在不同随机种子下的鲁棒性。
- 开发一种可自动生成有效示范而无需人工专业知识的方法。
- 为强化学习探索阶段提供解的完备性和采样复杂度的理论保证。
- 提升标准强化学习算法(如TRPO和DDPG)的渐近性能和收敛速度。
提出的方法
- 将强化学习探索问题建模为状态空间中的规划问题,利用RRT搜索成功轨迹。
- 从RRT解中生成示范,用于在梯度信息非零的区域初始化策略参数。
- 使用通用强化学习算法(如TRPO或DDPG)从RRT生成的初始化状态开始微调策略。
- 提供理论保证,证明R3L具有概率完备性,并推导出采样复杂度的上界。
- 采用无偏梯度估计的随机梯度下降,并通过更优的初始化实现方差减少。
- 通过将R3L探索阶段的采样时间计入总样本数,实现探索与学习的集成。
实验结果
研究问题
- RQ1基于规划的探索方法(使用RRT)是否能显著降低稀疏奖励强化学习中的样本复杂度?
- RQ2使用RRT生成的示范初始化策略是否能提升收敛速度和渐近性能?
- RQ3R3L能否降低TRPO等策略梯度方法在不同随机种子下的方差?
- RQ4R3L是否对糟糕的随机初始化具有鲁棒性,并且相较于内在探索或随机探索策略更有效?
- RQ5R3L探索阶段的完备性和采样复杂度可提供哪些理论保证?
主要发现
- 在所有测试环境中,R3L在中位数和上四分位数性能上均优于基线方法TRPO和DDPG,以及VIME-TRPO。
- R3L-TRPO和R3L-DDPG的收敛速度更快,且最终未折扣回报高于基线方法。
- R3L性能的下四分位数显著高于基线,表明其对随机种子和初始化的敏感性更低。
- R3L所需的探索样本数量仅为标准方法的一小部分,且结果中明确标示了探索阶段的分界。
- R3L预训练可缓解DDPG固有的不稳定性,使其在性能下降后仍能恢复。
- 该方法通过在具有信息性梯度的区域初始化,实现了更高的渐近性能,并减少了策略梯度更新的方差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。