[论文解读] Revisiting Discrete Soft Actor-Critic
本文重新审视了离散Soft Actor-Critic(SAC)方法,识别出两个关键的失败模式:由于熵更新无界导致的策略不稳定,以及由裁剪双Q学习引起的Q值低估。为解决这些问题,本文提出使用熵惩罚来约束策略更新,并采用带Q-clip的双平均Q学习以稳定值函数估计,显著提升了在Atari游戏和大规模多人在线战术竞技场游戏(Honor of Kings)中的性能。
We study the adaption of Soft Actor-Critic (SAC), which is considered as a state-of-the-art reinforcement learning (RL) algorithm, from continuous action space to discrete action space. We revisit vanilla discrete SAC and provide an in-depth understanding of its Q value underestimation and performance instability issues when applied to discrete settings. We thereby propose Stable Discrete SAC (SDSAC), an algorithm that leverages entropy-penalty and double average Q-learning with Q-clip to address these issues. Extensive experiments on typical benchmarks with discrete action space, including Atari games and a large-scale MOBA game, show the efficacy of our proposed method. Our code is at: https://github.com/coldsummerday/SD-SAC.git.
研究动机与目标
- 诊断并解决原始离散SAC在离散动作空间中表现不佳的问题,尽管其在连续控制领域已取得成功。
- 识别离散SAC训练不稳定和Q值低估的根本原因,特别是由无界策略更新和裁剪双Q学习引起的。
- 通过引入熵惩罚和带Q-clip的双平均Q学习,提升离散环境中的样本效率和训练稳定性。
- 在标准基准(Atari)和大规模工业级MOBA游戏(Honor of Kings)上验证所提方法,以证明其可扩展性。
提出的方法
- 在策略优化目标中引入熵惩罚,以约束策略更新的幅度,防止因突然的熵值变化导致训练不稳定。
- 提出双平均Q学习结合Q-clip,即对两个Q网络的输出进行平均,并将其结果裁剪至固定范围,以减少低估偏差。
- 采用Q-clip范围$c$来限制Q值估计,消融实验表明$c = 0.5$为最优选择。
- 使用可学习的熵惩罚系数$β$,实验表明$β = 0.5$能在探索与稳定性之间取得最佳平衡。
- 将该方法应用于Atari游戏和Honor of Kings 1v1环境,采用标准状态表示和离散动作空间。
- 通过ELO评分和训练曲线,定量比较所提方法与离散SAC及Rainbow基线模型的性能。
实验结果
研究问题
- RQ1为何原始离散SAC在Atari等离散环境中的表现不佳,尽管其在连续控制任务中表现优异?
- RQ2离散SAC在策略更新不稳定和Q值估计方面的主要失败模式是什么?
- RQ3熵惩罚如何改善离散SAC中的策略更新稳定性?
- RQ4带Q-clip的双平均Q学习能否有效减少离散SAC中的Q值低估?
- RQ5所提方法在Honor of Kings 1v1等大规模复杂环境中是否具备良好的可扩展性?
主要发现
- 所提方法在全部59款Atari游戏中显著优于原始离散SAC,平均人类归一化得分提升22.4%。
- 在Honor of Kings 1v1环境中,该方法在三个评估时间点(24、36和48小时)的ELO评分均高于离散SAC。
- 损失曲面可视化显示,所提方法的损失景观更平坦、更凸,表明优化过程更平滑。
- 消融实验确认,$β = 0.5$和$c = 0.5$在稳定性和性能之间实现了最佳权衡。
- 该方法降低了训练不稳定性并提升了样本效率,尤其在稀疏奖励环境中表现更优。
- 尽管有所改进,该方法在长时序决策任务中仍表现欠佳,表明其在长序列上的信用分配能力存在局限。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。