Skip to main content
QUICK REVIEW

[论文解读] From self-tuning regulators to reinforcement learning and back again

Nikolai Matni, Alexandre Proutière|arXiv (Cornell University)|Jun 27, 2019
Advanced Control Systems Optimization参考文献 123被引用 16
一句话总结

本文将控制理论中的自校准调节器与现代强化学习(RL)相连接,表明基于模型的RL方法在样本效率和有限时间性能保证方面优于无模型的策略梯度方法。研究证明,名义上的基于模型的控制器实现了接近最优的风险缩放 $ O(n_x n_u / N) $,而策略梯度方法则存在依赖于时间 $ T $ 的样本复杂度差距,从而证明在线性二次调节器(LQR)设置下,基于模型的方法近乎最优。

ABSTRACT

Machine and reinforcement learning (RL) are increasingly being applied to plan and control the behavior of autonomous systems interacting with the physical world. Examples include self-driving vehicles, distributed sensor networks, and agile robots. However, when machine learning is to be applied in these new settings, the algorithms had better come with the same type of reliability, robustness, and safety bounds that are hallmarks of control theory, or failures could be catastrophic. Thus, as learning algorithms are increasingly and more aggressively deployed in safety critical settings, it is imperative that control theorists join the conversation. The goal of this tutorial paper is to provide a starting point for control theorists wishing to work on learning related problems, by covering recent advances bridging learning and control theory, and by placing these results within an appropriate historical context of system identification and adaptive control.

研究动机与目标

  • 为控制理论研究者提供一个基础,使其能够参与基于学习的控制问题,通过将经典自适应控制与现代强化学习相连接。
  • 强调在学习型控制系统的有限数据保证和不确定性量化的重要性。
  • 从样本复杂度和线性系统性能边界的角度,比较基于模型与无模型的RL方法。
  • 在LQR设置下,为自校准调节器和策略梯度算法建立理论上的有限时间性能保证。
  • 证明基于模型的方法可实现近乎最优的样本复杂度,而无模型方法则面临可证明的性能差距。

提出的方法

  • 本文使用有限时域性能度量,分析了离散时间线性二次调节器(LQR)问题中基于模型的自校准调节器的风险。
  • 推导了名义控制器的渐近风险边界,表明当 $ N \to \infty $ 时,$ \mathbb{E}[J(\widehat{K}) - J_\star] \approx O(n_x n_u / N) $。
  • 评估了两种基线下的策略梯度方法——简单基线与价值函数基线,证明 $ \liminf_{N\to\infty} N \cdot \mathbb{E}[J(\widehat{K}) - J_\star] = \Omega(T^2 n_x^3 n_u) $ 和 $ \Omega(T n_x^2 n_u) $ 分别成立。
  • 提出了一项信息论下界,表明任何采用 $ u_t = Kx_t + \eta_t $ 形式的反馈机制的算法,其风险不可能优于 $ \Omega(n_u(n_x - n_u)/N) $,与基于模型的方法仅相差常数因子。
  • 利用最优控制、随机优化和高维统计的工具分析有限数据下的性能,特别强调不确定性量化。
  • 将近期强化学习的进展置于系统辨识与自适应控制的历史脉络中,强调其共同挑战与解决方案。

实验结果

研究问题

  • RQ1在LQR问题中,基于模型与无模型的RL方法在样本效率方面如何比较?
  • RQ2在LQR设置下,自校准调节器的有限时间性能保证可以如何建立?
  • RQ3策略梯度方法的风险能否以时域长度 $ T $、状态维数 $ n_x $ 和控制维数 $ n_u $ 表示?
  • RQ4在LQR设置下,名义上的基于模型控制器的性能是否在常数因子范围内最优?
  • RQ5不确定性量化在连接经典自适应控制与现代强化学习中起到何种作用?

主要发现

  • 基于模型的名义控制器实现了 $ O(n_x n_u / N) $ 的风险,该结果接近最优,由信息论下界证实。
  • 采用简单基线的策略梯度方法面临 $ \Omega(T^2 n_x^3 n_u / N) $ 的风险,表明存在依赖于 $ T^2 $ 的样本复杂度惩罚。
  • 即使采用价值函数基线,策略梯度方法的风险仍为 $ \Omega(T n_x^2 n_u / N) $,相比基于模型的方法仍差一个 $ T $ 的因子。
  • 基于模型的方法在所有使用有界增益和高斯噪声的线性反馈机制的算法中,性能仅相差常数因子,因此达到最优。
  • 结果证明了在LQR问题中,基于模型与无模型方法在样本复杂度方面存在可证明且量化的差距。
  • 通过整合最优控制、随机优化和高维统计工具,尤其在不确定性被量化时,可在强化学习中实现有限数据保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。