Skip to main content
QUICK REVIEW

[论文解读] Revisiting Discrete Soft Actor-Critic

Haibin Zhou, Wei, Tong|arXiv (Cornell University)|Sep 21, 2022
Neural Networks and Reservoir Computing被引用 11
一句话总结

本文重新审视了离散Soft Actor-Critic(SAC)方法,识别出两个关键的失败模式:由于熵更新无界导致的策略不稳定,以及由裁剪双Q学习引起的Q值低估。为解决这些问题,本文提出使用熵惩罚来约束策略更新,并采用带Q-clip的双平均Q学习以稳定值函数估计,显著提升了在Atari游戏和大规模多人在线战术竞技场游戏(Honor of Kings)中的性能。

ABSTRACT

We study the adaption of Soft Actor-Critic (SAC), which is considered as a state-of-the-art reinforcement learning (RL) algorithm, from continuous action space to discrete action space. We revisit vanilla discrete SAC and provide an in-depth understanding of its Q value underestimation and performance instability issues when applied to discrete settings. We thereby propose Stable Discrete SAC (SDSAC), an algorithm that leverages entropy-penalty and double average Q-learning with Q-clip to address these issues. Extensive experiments on typical benchmarks with discrete action space, including Atari games and a large-scale MOBA game, show the efficacy of our proposed method. Our code is at: https://github.com/coldsummerday/SD-SAC.git.

研究动机与目标

  • 诊断并解决原始离散SAC在离散动作空间中表现不佳的问题,尽管其在连续控制领域已取得成功。
  • 识别离散SAC训练不稳定和Q值低估的根本原因,特别是由无界策略更新和裁剪双Q学习引起的。
  • 通过引入熵惩罚和带Q-clip的双平均Q学习,提升离散环境中的样本效率和训练稳定性。
  • 在标准基准(Atari)和大规模工业级MOBA游戏(Honor of Kings)上验证所提方法,以证明其可扩展性。

提出的方法

  • 在策略优化目标中引入熵惩罚,以约束策略更新的幅度,防止因突然的熵值变化导致训练不稳定。
  • 提出双平均Q学习结合Q-clip,即对两个Q网络的输出进行平均,并将其结果裁剪至固定范围,以减少低估偏差。
  • 采用Q-clip范围$c$来限制Q值估计,消融实验表明$c = 0.5$为最优选择。
  • 使用可学习的熵惩罚系数$β$,实验表明$β = 0.5$能在探索与稳定性之间取得最佳平衡。
  • 将该方法应用于Atari游戏和Honor of Kings 1v1环境,采用标准状态表示和离散动作空间。
  • 通过ELO评分和训练曲线,定量比较所提方法与离散SAC及Rainbow基线模型的性能。

实验结果

研究问题

  • RQ1为何原始离散SAC在Atari等离散环境中的表现不佳,尽管其在连续控制任务中表现优异?
  • RQ2离散SAC在策略更新不稳定和Q值估计方面的主要失败模式是什么?
  • RQ3熵惩罚如何改善离散SAC中的策略更新稳定性?
  • RQ4带Q-clip的双平均Q学习能否有效减少离散SAC中的Q值低估?
  • RQ5所提方法在Honor of Kings 1v1等大规模复杂环境中是否具备良好的可扩展性?

主要发现

  • 所提方法在全部59款Atari游戏中显著优于原始离散SAC,平均人类归一化得分提升22.4%。
  • 在Honor of Kings 1v1环境中,该方法在三个评估时间点(24、36和48小时)的ELO评分均高于离散SAC。
  • 损失曲面可视化显示,所提方法的损失景观更平坦、更凸,表明优化过程更平滑。
  • 消融实验确认,$β = 0.5$和$c = 0.5$在稳定性和性能之间实现了最佳权衡。
  • 该方法降低了训练不稳定性并提升了样本效率,尤其在稀疏奖励环境中表现更优。
  • 尽管有所改进,该方法在长时序决策任务中仍表现欠佳,表明其在长序列上的信用分配能力存在局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。