[论文解读] Smoothed Action Value Functions for Learning Gaussian Policies
该论文提出了平滑动作价值函数——高斯平滑的Q值,可实现具有可学习均值和协方差的高斯策略的端到端训练。通过从平滑Q值的梯度和Hessian矩阵推导策略梯度,所提出的Smoothie算法在连续控制基准测试中表现优异,尤其在引入KL散度惩罚以增强稳定性时,性能优于DDPG,并在远少的环境交互步数下达到或超越TRPO的水平。
State-action value functions (i.e., Q-values) are ubiquitous in reinforcement learning (RL), giving rise to popular algorithms such as SARSA and Q-learning. We propose a new notion of action value defined by a Gaussian smoothed version of the expected Q-value. We show that such smoothed Q-values still satisfy a Bellman equation, making them learnable from experience sampled from an environment. Moreover, the gradients of expected reward with respect to the mean and covariance of a parameterized Gaussian policy can be recovered from the gradient and Hessian of the smoothed Q-value function. Based on these relationships, we develop new algorithms for training a Gaussian policy directly from a learned smoothed Q-value approximator. The approach is additionally amenable to proximal optimization by augmenting the objective with a penalty on KL-divergence from a previous policy. We find that the ability to learn both a mean and covariance during training leads to significantly improved results on standard continuous control benchmarks.
研究动机与目标
- 解决现有离策略算法(如DDPG)的局限性,这些算法将策略限制为确定性或固定协方差的高斯形式,导致探索能力差且训练不稳定。
- 开发一种方法,通过从Q值函数导出的梯度,实现高斯策略中均值和协方差的联合学习。
- 通过KL散度惩罚引入近端策略优化技术,提升训练稳定性,同时不损害样本效率。
- 证明可学习协方差在样本稀缺设置下显著提升复杂连续控制基准任务的性能。
提出的方法
- 提出一种新的Q值函数——平滑Q值 $\tilde{Q}^\pi(s,a)$,定义为当初始动作从以 $a$ 为中心、固定协方差 $\Sigma(s)$ 的高斯分布中采样时的期望回报。
- 证明策略均值的期望回报梯度等于 $\tilde{Q}^\pi$ 对动作的梯度,且对动作的Hessian矩阵等于对策略协方差的梯度。
- 提出Smoothie算法,使用函数逼近器表示 $\tilde{Q}^\pi$,并通过反向传播其梯度和Hessian矩阵,同时更新高斯策略的均值和协方差。
- 在策略目标中加入与前一策略的KL散度惩罚,实现近端优化,提升训练稳定性。
- 使用自举Bellman更新训练评论家网络,利用平滑Q值满足单步Bellman一致性方程的性质。
- 采用离策略经验回放和随机梯度下降,在类似DDPG的框架中联合优化评论家和演员网络,但支持完整的协方差学习。
实验结果
研究问题
- RQ1能否定义一种平滑Q值函数,使其对动作的梯度和Hessian矩阵分别对应于高斯策略均值和协方差的策略梯度?
- RQ2在高斯策略中同时学习均值和协方差是否能提升连续控制基准任务中的样本效率和性能表现?
- RQ3能否将近端策略优化技术(如KL惩罚正则化)有效整合进一个学习完整高斯策略的离策略算法中?
- RQ4与DDPG和TRPO相比,同时学习均值和协方差的方法在最终回报和样本效率方面表现如何?
主要发现
- 在Hopper环境中,Smoothie相比DDPG实现了平均回报2倍的提升,充分证明了可学习协方差带来的显著性能增益。
- 在Humanoid任务中,加入KL惩罚的Smoothie在仅使用数百万次环境交互步数的模型中达到SOTA水平,甚至超越需要数千万步的TRPO。
- 为Smoothie引入KL惩罚后,性能显著提升,尤其在Hopper和Humanoid上,表明训练稳定性得到增强。
- Smoothie在所有基准测试中均优于DDPG,尤其在Hopper、Walker2d、Ant和Humanoid上提升最大,凸显了探索性、非确定性策略的优势。
- 该方法成功避免了标准策略梯度方法的高方差和样本低效性,同时保持了DDPG的离策略效率。
- 理论分析证实,平滑Q值满足Bellman方程,支持自举函数逼近和稳定训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。