Skip to main content
QUICK REVIEW

[论文解读] Hybrid Actor-Critic Reinforcement Learning in Parameterized Action Space

Fan Zhou, Rui Su|arXiv (Cornell University)|Mar 4, 2019
Reinforcement Learning in Robotics参考文献 17被引用 9
一句话总结

该论文提出了一种用于参数化动作空间的混合演员-评论家强化学习架构,通过多个并行子演员网络联合处理离散和连续动作分量,由共享的全局评论家进行指导。该方法名为混合近端策略优化(H-PPO),在四个基准任务中相比先前方法(如DQN和P-DQN)表现出更优的性能,具有更快的收敛速度、更高的成功率以及更低的方差。

ABSTRACT

In this paper we propose a hybrid architecture of actor-critic algorithms for reinforcement learning in parameterized action space, which consists of multiple parallel sub-actor networks to decompose the structured action space into simpler action spaces along with a critic network to guide the training of all sub-actor networks. While this paper is mainly focused on parameterized action space, the proposed architecture, which we call hybrid actor-critic, can be extended for more general action spaces which has a hierarchical structure. We present an instance of the hybrid actor-critic architecture based on proximal policy optimization (PPO), which we refer to as hybrid proximal policy optimization (H-PPO). Our experiments test H-PPO on a collection of tasks with parameterized action space, where H-PPO demonstrates superior performance over previous methods of parameterized action reinforcement learning.

研究动机与目标

  • 为解决在参数化动作空间中训练强化学习智能体的挑战,其中动作由离散选择与连续参数组合而成。
  • 提升在标准深度强化学习算法难以有效处理的复杂动作空间中的样本效率和学习稳定性。
  • 设计一种灵活的架构,可扩展至一般层次化动作结构,而不仅限于参数化动作空间。
  • 开发一种基于PPO的实现(H-PPO),利用多个并行智能体之间的共享评论家监督,实现协调的策略学习。

提出的方法

  • 该架构采用多个并行的子演员网络,每个网络负责学习层次化动作空间中的特定组件——离散动作选择和连续参数选择。
  • 一个单一的全局评论家网络评估状态-动作对,并为所有子演员网络同时提供统一的价值信号。
  • 评论家使用共享的价值函数计算优势估计,通过统一的目标函数实现在所有子演员之间的稳定策略更新。
  • 该方法具体实现为H-PPO,通过应用PPO的裁剪机制来稳定训练,同时保持离散和连续策略头之间的协调。
  • 网络架构在子演员之间共享早期层,以促进特征共享并提升泛化能力,同时为离散和连续动作分别设置独立的策略头。
  • 训练过程在子演员的策略更新与评论家的价值函数更新之间交替进行,使用统一的损失函数来平衡两个组件。

实验结果

研究问题

  • RQ1具有并行子演员和全局评论家的混合演员-评论家架构是否能提升在参数化动作空间中的学习稳定性和性能?
  • RQ2H-PPO在成功率、收敛速度和方差方面与标准DQN和P-DQN相比表现如何,尤其是在多样化任务中?
  • RQ3该混合架构在多大程度上可泛化至参数化动作之外的其他层次化动作空间结构?
  • RQ4在多个子演员之间共享评论家监督是否能带来更协调且高效的策略学习?

主要发现

  • 在‘Moving’环境中,H-PPO的成功率为90.45% ± 6.75%,显著优于P-DQN(1.56% ± 2.78%)和DQN(0.00%)。
  • 在‘Chase and Attack’环境中,H-PPO的成功率达到99.98% ± 0.30%,方差最低,优于DQN(99.91% ± 0.74%)和P-DQN(99.85% ± 0.84%)。
  • 在‘Half Field Football’任务中,H-PPO的成功率为95.39% ± 4.81%,超过P-DQN(76.31% ± 16.81%)和DQN(0.00%)。
  • H-PPO在所有四个环境中均表现出更快的收敛速度和更稳定的训练曲线,性能方差低于基线方法。
  • 在所有环境中,H-PPO的平均回合奖励均高于DQN和P-DQN,其中在Half Field Football中达到最高奖励9.849。
  • 定性分析表明,H-PPO成功学习到将离散动作(如TURN、DASH、KICK)与适当的连续参数(如角度、力度、方向)协调配合,如Half Field Football中的逐帧行为所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。