[论文解读] Meta-SAC: Auto-tune the Entropy Temperature of Soft Actor-Critic via Metagradient
本文提出 Meta-SAC,一种基于元梯度的方法,可自动调节 Soft Actor-Critic (SAC) 中的熵温度,且无需引入额外的自适应超参数。通过优化与标准强化学习回报对齐的新元目标,Meta-SAC 在具有挑战性的 Mujoco 任务上实现了最先进性能,在困难的 humanoid-v2 环境中比 SAC-v2 提升超过 10%。
Exploration-exploitation dilemma has long been a crucial issue in reinforcement learning. In this paper, we propose a new approach to automatically balance between these two. Our method is built upon the Soft Actor-Critic (SAC) algorithm, which uses an "entropy temperature" that balances the original task reward and the policy entropy, and hence controls the trade-off between exploitation and exploration. It is empirically shown that SAC is very sensitive to this hyperparameter, and the follow-up work (SAC-v2), which uses constrained optimization for automatic adjustment, has some limitations. The core of our method, namely Meta-SAC, is to use metagradient along with a novel meta objective to automatically tune the entropy temperature in SAC. We show that Meta-SAC achieves promising performances on several of the Mujoco benchmarking tasks, and outperforms SAC-v2 over 10% in one of the most challenging tasks, humanoid-v2.
研究动机与目标
- 解决 SAC 对熵温度超参数的敏感性问题,该参数在探索与利用之间起关键平衡作用。
- 克服 SAC-v2 的局限性,尽管其能自动适应 α,但仍需调参目标熵超参数。
- 开发一种在训练过程中自动适应熵温度 α 的方法,且不引入新的自适应超参数。
- 设计一个与标准强化学习评估指标对齐的元目标,以提升学习效率和最终性能。
提出的方法
- 使用元梯度通过反向传播学习过程来优化熵温度 α,以最小化新型元损失。
- 将元损失定义为策略经过一次策略更新后的期望回报,使其与标准强化学习目标和评估指标保持一致。
- 利用链式法则推导元损失关于 α 的梯度,从而实现在 SAC 训练过程中对 α 的端到端优化。
- 通过避免对 Q 值网络输出关于 α 的梯度计算,防止数值不稳定性,转而依赖策略梯度更新。
- 将元梯度更新集成到 SAC 算法中,使用计算出的梯度在每个训练步骤更新 α。
- 通过使用可微的元目标反映环境中的实际性能,确保方法在样本效率和稳定性方面保持良好表现。
实验结果
研究问题
- RQ1元梯度方法能否在不引入额外自适应超参数的情况下,自动调节 SAC 中的熵温度 α?
- RQ2Meta-SAC 与 SAC-v2 在训练过程中 α 的演化有何不同,这对探索-利用权衡意味着什么?
- RQ3与现有自动 α 调节方法相比,与标准强化学习回报对齐的所提元目标是否能带来更好的最终性能?
- RQ4Meta-SAC 在具有挑战性的 Mujoco 环境中的表现如何,特别是在高维状态空间(如 humanoid-v2)的任务中?
主要发现
- 在具有挑战性的 humanoid-v2 环境中,Meta-SAC 的最终回报比 SAC-v2 提升超过 10%,表明其在复杂任务中具有优越性能。
- 在较简单的 Mujoco 任务(Ant-v2、Hopper-v2、Walker2d-v2)中,Meta-SAC 的性能与 SAC-v2 相当,略逊于使用网格搜索调优 α 的 SAC-v1。
- Meta-SAC 中的熵温度 α 随时间显著下降,在训练后期趋近于零,表明其从探索向利用的转变。
- 相比之下,SAC-v2 的 α 在早期训练后基本保持不变,表明其对学习进度的动态适应能力有限。
- Meta-SAC 中 α 的动态适应与更高的样本效率和更快的收敛速度相关,尤其在高维控制任务中表现明显。
- 消融实验证实,所提出的元目标比其他形式更有效,因其与强化学习基准中实际使用的评估指标对齐得更好。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。