QUICK REVIEW
[论文解读] Analyzing the Variance of Policy Gradient Estimators for the Linear-Quadratic Regulator
James A. Preiss, Sébastien M. R. Arnold|arXiv (Cornell University)|Oct 2, 2019
Reinforcement Learning in Robotics参考文献 17被引用 5
一句话总结
本文推导了在具有连续状态、动作和高斯噪声的线性二次调节器(LQR)问题中,REINFORCE策略梯度估计器方差的解析边界。结果表明,方差随系统参数(如噪声协方差和时间范围)而变化,并通过实验验证了这些边界,揭示了更高的动作噪声尽管增加了梯度方差,却可能 paradoxically 加速学习。
ABSTRACT
We study the variance of the REINFORCE policy gradient estimator in environments with continuous state and action spaces, linear dynamics, quadratic cost, and Gaussian noise. These simple environments allow us to derive bounds on the estimator variance in terms of the environment and noise parameters. We compare the predictions of our bounds to the empirical variance in simulation experiments.
研究动机与目标
- 理解连续MDP中策略梯度估计器的方差如何依赖于底层系统参数。
- 推导在具有高斯噪声的有限时域LQR问题中,REINFORCE估计器方差的显式上界和下界。
- 在模拟的LQR环境中,将理论方差边界与实际测量值进行验证。
- 研究在优化景观存在干扰效应的情况下,梯度方差与样本复杂度之间的关系。
- 探讨尽管梯度方差增加,动作噪声是否仍能提升学习速度。
提出的方法
- 利用线性动力学、二次代价函数和有限时域LQR问题中的高斯噪声结构,推导REINFORCE梯度估计器方差的上界。
- 基于策略梯度的Hessian矩阵,推导标量情况下在平稳策略下的方差下界。
- 使用矩阵范数和谱半径,将边界表示为系统矩阵(A, B)、代价矩阵(Q, R)和噪声协方差(Σs, Σa)的函数。
- 通过采样轨迹并计算1000个随机LQR实例中经验梯度方差,对预测方差进行实验评估。
- 在不同动作噪声(Σa)和系统噪声(Σs)下测试REINFORCE的学习性能,测量在无噪声评估环境中的收敛速度。
- 应用随机矩阵理论的洞见,解释高维LQR问题中的聚类行为。
实验结果
研究问题
- RQ1在LQR问题中,REINFORCE策略梯度估计器的方差如何随系统参数(如噪声协方差和时间范围)变化?
- RQ2解析边界能否准确预测随机LQR环境中策略梯度估计的经验方差?
- RQ3更高的动作噪声(Σa)是否以一致方式增加梯度方差,从而降低REINFORCE的收敛性?
- RQ4在两者均依赖于相同系统参数的前提下,梯度方差与样本复杂度之间存在何种关系?
- RQ5为何增加动作噪声有时反而导致REINFORCE收敛更快,这与方差分析的直觉相悖?
主要发现
- 理论上的REINFORCE梯度方差上界在广泛范围的LQR问题实例中与经验方差在定性上一致。
- 标量情况下的下界与经验方差趋势一致,特别是在对系统噪声和动作噪声参数的依赖关系上。
- 梯度方差随时间范围H和状态维度n呈超线性增长,且在高维情况下增长更为陡峭。
- 尽管梯度方差增加,更大的动作噪声(Σa)反而导致REINFORCE更快收敛,表明其在探索或正则化方面具有有益作用。
- 当Σa极小而Σs较大时,REINFORCE在不同随机种子下表现出高方差和不稳定性,表明存在一个关键的训练临界区域。
- 结果表明,动作噪声对学习的影响无法仅通过方差完全解释,暗示存在其他机制,如策略探索和正则化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。