Skip to main content
QUICK REVIEW

[论文解读] Discretizing Continuous Action Space for On-Policy Optimization

Yunhao Tang, Shipra Agrawal|arXiv (Cornell University)|Jan 29, 2019
Reinforcement Learning in Robotics参考文献 36被引用 16
一句话总结

本文通过在动作维度上因子化策略,提出对在线强化学习中的连续动作空间进行离散化,使PPO和TRPO等最先进算法能够高效训练。此外,还引入了一种类序参数化方法,编码离散动作之间的自然顺序,显著提升了样本效率和最终性能,尤其在具有复杂动力学的高维控制任务中表现突出。

ABSTRACT

In this work, we show that discretizing action space for continuous control is a simple yet powerful technique for on-policy optimization. The explosion in the number of discrete actions can be efficiently addressed by a policy with factorized distribution across action dimensions. We show that the discrete policy achieves significant performance gains with state-of-the-art on-policy optimization algorithms (PPO, TRPO, ACKTR) especially on high-dimensional tasks with complex dynamics. Additionally, we show that an ordinal parameterization of the discrete distribution can introduce the inductive bias that encodes the natural ordering between discrete actions. This ordinal architecture further significantly improves the performance of PPO/TRPO.

研究动机与目标

  • 探究对连续动作空间进行离散化是否能提升在线强化学习算法的性能。
  • 通过在动作维度上因子化策略分布,缓解离散动作组合带来的组合爆炸问题。
  • 评估通过类序参数化编码离散动作之间的自然顺序,是否能为策略优化提供有益的归纳偏置。
  • 在高维连续控制环境中,对比离散与类序策略与标准高斯基线的表现。
  • 评估离散与类序策略对学习率和每维离散桶数等超参数变化的鲁棒性。

提出的方法

  • 将每个维度的连续动作空间离散化为K个离散动作,形成M维动作的联合离散动作空间,大小为K^M。
  • 采用因子化策略,将联合动作分布建模为各动作维度边缘分布的乘积,降低计算复杂度。
  • 引入基于stick-breaking的类序参数化,编码离散动作之间的自然顺序,实现更平滑的策略更新。
  • 在MuJoCo运动基准上,将离散与类序策略应用于PPO、TRPO和ACKTR等在线算法进行训练。
  • 使用固定超参数训练策略,并通过多组随机种子评估性能,以评估鲁棒性。
  • 在类序架构中使用Beta分布作为离散动作的先验,以支持可微采样与策略优化。

实验结果

研究问题

  • RQ1对连续动作空间进行离散化是否能提升PPO和TRPO等在线算法在高维控制任务中的性能?
  • RQ2在离散动作上使用因子化策略是否能缓解动作组合的组合爆炸问题,同时保持性能?
  • RQ3通过stick-breaking参数化编码离散动作之间的自然顺序,是否能为策略优化提供有益的归纳偏置?
  • RQ4与标准高斯策略基线相比,离散/类序策略在样本效率和最终性能方面表现如何?
  • RQ5离散与类序策略对学习率和离散桶数等超参数变化的鲁棒性如何?

主要发现

  • 采用因子化动作分布的离散策略在高维任务(如Humanoid和Ant)上显著优于高斯基线,在Walker2d上获得4249±239的回报(高斯基线为3500±360),在Humanoid上获得6018±403的回报(高斯基线为3905±502)。
  • 编码自然顺序的类序策略进一步提升性能,在Humanoid (R)上达到4884±1562的回报,在Sim. Humanoid (R)上达到801±569的回报,优于离散策略。
  • 在Humanoid任务中,PPO+类序策略达到6018±403的回报,与当前最先进的离策略算法相当。
  • 离散策略对超参数变化(学习率、K值、随机种子)的鲁棒性优于高斯基线,如在30组超参数配置下的分位数图所示。
  • 在TRPO实验中,类序策略在所有任务中均持续优于离散策略,其中在Ant任务中提升达2977±266,在Humanoid Standup任务中提升达143418±8638。
  • 图4的学习曲线显示,在K=11时,类序策略在所有MuJoCo运动任务中收敛更快且达到更高的渐近性能,优于离散策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。