[论文解读] Neural Proximal/Trust Region Policy Optimization Attains Globally Optimal Policy
本文首次为使用过参数化两层神经网络的近端策略优化(PPO)和信任域策略优化(TRPO)变体建立了非渐近全局收敛速率。通过在单点单调性条件下对无限维镜像下降进行建模,并利用过参数化网络的优化几何结构,作者证明了PPO以子线性速率 $O(1/\sqrt{K})$ 收敛至全局最优策略,其中 $K$ 为迭代次数,且对策略评估与策略改进子程序提供了非渐近边界。
Proximal policy optimization and trust region policy optimization (PPO and TRPO) with actor and critic parametrized by neural networks achieve significant empirical success in deep reinforcement learning. However, due to nonconvexity, the global convergence of PPO and TRPO remains less understood, which separates theory from practice. In this paper, we prove that a variant of PPO and TRPO equipped with overparametrized neural networks converges to the globally optimal policy at a sublinear rate. The key to our analysis is the global convergence of infinite-dimensional mirror descent under a notion of one-point monotonicity, where the gradient and iterate are instantiated by neural networks. In particular, the desirable representation power and optimization geometry induced by the overparametrization of such neural networks allow them to accurately approximate the infinite-dimensional gradient and iterate.
研究动机与目标
- 通过为使用神经网络参数化的PPO和TRPO建立全局收敛保证,弥合深度强化学习中的理论与实践差距。
- 解决由于策略空间中的非凸性及神经网络参数化导致的全局收敛性理解不足问题。
- 分析在神经网络近似下,PPO/TRPO中策略评估(通过TD学习)与策略改进(通过SGD)之间的相互作用。
- 为在每次PPO迭代中实现 $\epsilon$-精度的策略评估与策略改进,提供TD和SGD迭代次数的非渐近边界。
- 统一分析过参数化神经网络中评论家与演员网络的均方贝尔曼误差(MSBE)与均方误差(MSE)的收敛性。
提出的方法
- 将理想策略更新形式化为无限维镜像下降,将精确的动作价值函数视为对偶迭代,将策略视为原始迭代。
- 引入期望回报的单点单调性,以确保在非凸性条件下仍能收敛至最优策略。
- 将策略评估误差建模为对偶误差,将策略改进误差建模为原始误差,二者源于评论家与演员的神经网络近似。
- 在过参数化两层ReLU网络中,建立MSBE(用于TD学习)与MSE(用于SGD)的全局收敛性,收敛速率为子线性。
- 在神经正切核(NTK)框架下,统一分析TD与SGD的收敛性,利用过参数化实现精确近似。
- 将对偶误差与原始误差整合进镜像下降框架,推导出使用神经网络的PPO的全局收敛速率。
实验结果
研究问题
- RQ1使用神经网络参数化的PPO是否能全局收敛至最优策略?收敛速率如何?
- RQ2为在每次PPO迭代中实现 $\epsilon$-精度的策略评估,需要多少TD迭代?
- RQ3为在每次PPO迭代中实现 $\epsilon$-精度的策略改进,需要多少SGD迭代?
- RQ4非凸的、无限维的策略优化问题是否可在单点单调性条件下通过镜像下降进行分析?
- RQ5过参数化神经网络是否能实现策略评估与策略改进子程序的全局收敛?
主要发现
- 所提出的使用过参数化两层ReLU网络的PPO变体,以 $O(1/\sqrt{K})$ 的速率全局收敛至最优策略,其中 $K$ 为迭代次数。
- 为通过时序差分学习实现 $\epsilon$-精度的策略评估,$O(1/\epsilon^2)$ 次TD迭代已足够。
- 为通过随机梯度下降实现 $\epsilon$-精度的策略改进,$O(1/\epsilon^2)$ 次SGD迭代已足够。
- 由于过参数化网络的表示能力与优化几何结构,MSBE(用于评论家)与MSE(用于演员)的收敛性均以子线性速率实现全局保证。
- 分析表明,策略评估与策略改进误差在迭代过程中累积,但其子线性收敛性确保了PPO的整体全局收敛性。
- 证明框架统一了NTK框架下TD与SGD的收敛性,为基于神经网络的策略优化提供了系统性分析。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。