[论文解读] Derivative-Free Policy Optimization for Linear Risk-Sensitive and Robust Control Design: Implicit Regularization and Sample Complexity
本文提出了首个用于线性风险敏感及鲁棒控制的无导数策略优化方法,通过轨迹采样实现全局收敛与有限样本复杂度。它建立了隐式正则化机制,在学习过程中保持鲁棒性,确保在安全关键系统中的稳定性。
Direct policy search serves as one of the workhorses in modern reinforcement learning (RL), and its applications in continuous control tasks have recently attracted increasing attention. In this work, we investigate the convergence theory of policy gradient (PG) methods for learning the linear risk-sensitive and robust controller. In particular, we develop PG methods that can be implemented in a derivative-free fashion by sampling system trajectories, and establish both global convergence and sample complexity results in the solutions of two fundamental settings in risk-sensitive and robust control: the finite-horizon linear exponential quadratic Gaussian, and the finite-horizon linear-quadratic disturbance attenuation problems. As a by-product, our results also provide the first sample complexity for the global convergence of PG methods on solving zero-sum linear-quadratic dynamic games, a nonconvex-nonconcave minimax optimization problem that serves as a baseline setting in multi-agent reinforcement learning (MARL) with continuous spaces. One feature of our algorithms is that during the learning phase, a certain level of robustness/risk-sensitivity of the controller is preserved, which we termed as the implicit regularization property, and is an essential requirement in safety-critical control systems.
研究动机与目标
- 解决无模型策略梯度(PG)方法在风险敏感与鲁棒控制设置下缺乏理论收敛保证的问题。
- 克服线性指数二次高斯(LEQG)与线性二次(LQ)扰动抑制问题中非强制性目标函数的挑战。
- 建立此类非凸、非凹极小化-极大化控制问题中PG方法的有限样本复杂度。
- 首次在无模型设置下进行隐式正则化分析,确保学习过程中鲁棒性得以保持。
- 将先前在已知模型设置下的隐式正则化结果,拓展至基于样本、无导数的PG方法。
提出的方法
- 通过LEQG与LQ扰动抑制问题与其等价的线性二次动态博弈的联系,构建统一的策略优化框架。
- 提出一种无导数PG方法,利用系统轨迹样本估计梯度,避免使用解析导数。
- 引入一种新颖的隐式正则化论证,确保即使在非强制性目标下,PG迭代仍保持在鲁棒性可行集中。
- 建立统一的边界约束以容忍无模型设置下的统计误差,克服先前基于模型的隐式正则化方法的局限性。
- 采用类似李雅普诺夫的分析与矩阵扰动理论,界定向量控制器与协态矩阵的范数,确保稳定性与收敛性。
- 利用Riccati方程与博弈论公式的结构,推导出策略梯度的Lipschitz连续性。
实验结果
研究问题
- RQ1无模型策略梯度方法能否在非强制性目标下,实现风险敏感与鲁棒控制问题的全局收敛?
- RQ2在LEQG与LQ扰动抑制问题中,无导数PG方法是否会出现隐式正则化?
- RQ3在有限时域下,PG方法求解这些鲁棒控制问题的样本复杂度是多少?
- RQ4在无显式障碍函数或模型知识的情况下,能否在学习过程中保持鲁棒性?
- RQ5与已知模型设置相比,无模型设置下的隐式正则化在边界与稳定性方面有何差异?
主要发现
- 本文首次建立了无模型策略梯度方法在线性风险敏感与鲁棒控制问题中的有限样本复杂度结果。
- 证明了由于隐式正则化,即使目标函数非强制,PG迭代仍能保持在鲁棒性可行集中。
- 该方法对有限时域LEQG与LQ扰动抑制问题,均能实现对最优控制器的全局收敛。
- 隐式正则化特性确保学习到的控制器在整个训练过程中保持一定的风险敏感性与鲁棒性。
- 分析提供了控制器范数与协态矩阵范数的显式界,从而实现有限样本收敛性保证。
- 结果可推广至零和线性二次动态博弈,首次为具有连续动作空间的多智能体强化学习(MARL)提供了全局收敛的样本复杂度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。