[论文解读] Sample-based Distributional Policy Gradient
本文提出了一种新型的演员-评论家强化学习算法——基于样本的分布式策略梯度(SDPG),该算法通过再参数化噪声样本而非离散的类别化或分位数表示来建模回报分布。通过结合基于样本的回报分布估计与分位数Huber损失,SDPG在OpenAI Gym套件中的多个连续控制环境中,相较于D4PG实现了更高的样本效率和更高的平均回报。
Distributional reinforcement learning (DRL) is a recent reinforcement learning framework whose success has been supported by various empirical studies. It relies on the key idea of replacing the expected return with the return distribution, which captures the intrinsic randomness of the long term rewards. Most of the existing literature on DRL focuses on problems with discrete action space and value based methods. In this work, motivated by applications in robotics with continuous action space control settings, we propose sample-based distributional policy gradient (SDPG) algorithm. It models the return distribution using samples via a reparameterization technique widely used in generative modeling and inference. We compare SDPG with the state-of-art policy gradient method in DRL, distributed distributional deterministic policy gradients (D4PG), which has demonstrated state-of-art performance. We apply SDPG and D4PG to multiple OpenAI Gym environments and observe that our algorithm shows better sample efficiency as well as higher reward for most tasks.
研究动机与目标
- 为解决现有分布式强化学习(DRL)方法在连续动作空间设置下的局限性,特别是D4PG等算法中价值分布表示的固定分辨率与样本效率低下问题。
- 在DRL框架内开发一种策略梯度方法,通过使用再参数化的样本回报分布,避免离散化与投影操作。
- 通过实现高分辨率、灵活的回报分布建模(无需事先知晓回报边界),提升连续控制任务中的样本效率与最终性能。
- 证明基于再参数化的样本化回报分布学习可实现比离散类别化表示更好的泛化能力与更快的收敛速度。
提出的方法
- SDPG使用再参数化技术,从简单的噪声分布(如高斯分布)中生成回报分布样本,从而实现可微分采样与端到端训练。
- 评论家网络通过一种变体的分位数Huber损失进行训练,该损失作为Wasserstein距离的代理,用于比较学习到的与目标回报分布。
- 该算法遵循演员-评论家框架:演员网络参数化策略,而评论家网络通过将分布式Bellman方程应用于采样回报,近似目标回报分布。
- 回报分布通过样本隐式表示,使得训练后可无固定离散化地实现任意分辨率的重构。
- 该方法避免了对回报边界范围的领域知识需求,并消除了D4PG中所需的投影步骤,从而降低了训练复杂度。
- 训练过程通过最小化评论家采样回报分布与由分布式Bellman更新推导出的目标分布之间的分位数Huber损失来实现。
实验结果
研究问题
- RQ1在连续控制任务中,与D4PG等离散类别化方法相比,DRL中的基于样本的回报分布表示是否能提升样本效率?
- RQ2与固定分辨率的类别化或分位数表示相比,噪声样本的再参数化是否能实现更具表现力和灵活性的回报分布建模?
- RQ3在分布式强化学习中,若省去投影步骤并无需回报边界的先验知识,是否能带来更好的泛化能力与训练稳定性?
- RQ4采样回报的数量如何影响策略梯度算法的性能与收敛速度?
- RQ5所提出的方法是否在平均回报与学习进度上优于当前最先进的DRL策略梯度基线方法?
主要发现
- 在所有评估的环境中,SDPG相较于D4PG表现出显著更高的样本效率,达到目标回报阈值所需的episode数显著更少。
- 在Pendulum-v1环境中,SDPG平均仅需481个episode即可达到-150的回报阈值,而D4PG需要1605个episode。
- 在Reacher-v2环境中,SDPG达到-7回报所需episode数为11,859,而D4PG需要36,623个episode。
- 在HalfCheetah-v2环境中,SDPG在1.0×10⁶步后达到平均回报10,607 ± 845.04,优于D4PG的9,565.06 ± 209.77。
- 在Humanoid-v2环境中,SDPG表现出轻微性能滞后(5,093.62 ± 402.25 vs. 6,064.14 ± 192.84),但趋势显示其性能仍在持续提升,表明在更长训练周期下可能实现更优的最终性能。
- 在BipedalWalker-v2环境中,SDPG的评论家网络成功学习了目标回报分布,表现为生成分布与目标分布直方图近乎完美匹配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。