Skip to main content
QUICK REVIEW

[论文解读] Discrete and Continuous Action Representation for Practical RL in Video Games

Olivier Delalleau, Maxim Peter|arXiv (Cornell University)|Dec 23, 2019
Human Pose and Action Recognition参考文献 26被引用 39
一句话总结

本论文提出 Hybrid SAC,是 Soft Actor-Critic 的扩展,能够处理离散、连续以及混合离散-连续动作,并在参数化动作基准和商业电子游戏上评估其性能;它还研究了在 SAC 下使用正则化流(normalizing flows)的情况。

ABSTRACT

While most current research in Reinforcement Learning (RL) focuses on improving the performance of the algorithms in controlled environments, the use of RL under constraints like those met in the video game industry is rarely studied. Operating under such constraints, we propose Hybrid SAC, an extension of the Soft Actor-Critic algorithm able to handle discrete, continuous and parameterized actions in a principled way. We show that Hybrid SAC can successfully solve a highspeed driving task in one of our games, and is competitive with the state-of-the-art on parameterized actions benchmark tasks. We also explore the impact of using normalizing flows to enrich the expressiveness of the policy at minimal computational cost, and identify a potential undesired effect of SAC when used with normalizing flows, that may be addressed by optimizing a different objective.

研究动机与目标

  • 在工业环境中激励强化学习的应用,考虑到视频游戏开发中常见的数据和运行时约束。
  • 开发一个在 SAC 框架内可处理离散、连续和混合动作的实用离策略算法(Hybrid SAC)。
  • 评估正则化流对在现实任务中遵循 SAC 目标时策略表达能力和学习的影响。
  • 在参数化动作基准上将 Hybrid SAC 与最先进的方法进行比较。
  • 展示其在真实的育碧(Ubisoft)游戏场景中的适用性,以体现行业相关性。

提出的方法

  • 提出一种通用的行动表示,将 pi(a|s) 分解为 pi(a^d|s) 和 pi(a^c|s,a^d),以容纳混合动作类型。
  • 通过学习离散动作分布以及在离散选择条件下的连续动作来扩展 SAC 成 Hybrid SAC,同时让 critic 为离散动作预测 Q 值。
  • 使用加权熵正则项 alpha^d H(pi(a^d|s)) + alpha^c sum_{a^d} pi(a^d|s) H(pi(a^c|s,a^d)) 来在离散部分和连续部分之间平衡探索。
  • 给出网络结构,使 actor 要么输出分离的离散分布和连续参数,要么在多个组成部分上共享表示。
  • 探讨几种实际的策略参数化,并讨论在每个离散动作下何时重复连续组件以简化学习。
  • 在高斯策略之上尝试正则化流以增强表达能力,同时注意在 SAC 目标下可能出现的崩溃/收敛性问题。

实验结果

研究问题

  • RQ1Hybrid SAC 是否能够在实际视频游戏任务中有效学习具有混合离散和连续动作的策略?
  • RQ2与纯离散或纯连续基线相比,所提出的动作分解如何影响数据效率和学习性能?
  • RQ3正则化流在实际中是提升还是下降 SAC 的性能,以及在何种目标函数下?
  • RQ4哪些体系结构和参数化选择最适合扩展到符合行业约束的参数化动作空间?
  • RQ5与 MP-DQN 等最先进方法相比,Hybrid SAC 在参数化动作基准上的表现如何?

主要发现

  • Hybrid SAC 在参数化动作基准上取得有竞争力的性能,在 Platform 上达到与 MP-DQN 相匹配,在 Goal 上接近 MP-DQN,但在 HFO 上存在一些差距。
  • 在一款商业游戏中,Hybrid SAC 展现了在离散手刹与连续加速和转向下的成功高速度驾驶。
  • 在 Roboschool 基准测试中,将正则化流与 SAC 结合并未持续超越高斯策略,提示需要超越 KL 的其他目标以用于流。
  • 识别出一个潜在问题:熵奖励可能在离散动作概率很小时导致连续参数塌缩,初步尝试解决这一问题与 MP-DQN 的结果一致。
  • 实验表明策略表示选择的重要性;在离散集合可控的情况下,对每个离散动作重复连续参数可以帮助学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。