Skip to main content
QUICK REVIEW

[论文解读] Online Optimal Control with Affine Constraints

Yingying Li, Subhro Das|arXiv (Cornell University)|Oct 10, 2020
Advanced Bandit Algorithms Research参考文献 47被引用 4
一句话总结

本文提出了一种新型在线最优控制算法——带缓冲区的在线梯度下降(OGD-BZ),用于具有仿射状态和动作约束的线性系统,在有界扰动下实现鲁棒约束满足。OGD-BZ 确保所有时间步的约束均被满足,并实现了 $\tilde{O}(\sqrt{T})$ 的策略遗憾上界,使其成为首个在对抗性成本变化下同时具备次线性遗憾与硬约束满足理论保证的算法。

ABSTRACT

This paper considers online optimal control with affine constraints on the states and actions under linear dynamics with bounded random disturbances. The system dynamics and constraints are assumed to be known and time-invariant but the convex stage cost functions change adversarially. To solve this problem, we propose Online Gradient Descent with Buffer Zones (OGD-BZ). Theoretically, we show that OGD-BZ with proper parameters can guarantee the system to satisfy all the constraints despite any admissible disturbances. Further, we investigate the policy regret of OGD-BZ, which compares OGD-BZ's performance with the performance of the optimal linear policy in hindsight. We show that OGD-BZ can achieve a policy regret upper bound that is the square root of the horizon length multiplied by some logarithmic terms of the horizon length under proper algorithm parameters.

研究动机与目标

  • 设计一种在线控制算法,能够在有界随机扰动下,同时最小化对抗性变化的凸成本,并保证硬约束满足。
  • 通过提供在时变、约束控制设置下,关于次线性策略遗憾与鲁棒约束满足的理论保证,弥补现有文献中的空白。
  • 通过在优化框架中设计缓冲区,明确定义约束鲁棒性与遗憾性能之间的权衡。

提出的方法

  • 利用鲁棒优化和无约束在线控制的技术,将约束在线最优控制问题转化为具有时序耦合成本和约束的等价在线凸优化(OCO)问题。
  • 引入缓冲区以收紧约束集,并考虑问题转换过程中引入的近似误差,从而在扰动下确保鲁棒可行性。
  • 对转换后的 OCO 问题应用在线梯度下降(OGD)算法,得到 OGD-BZ 算法。
  • 通过涉及绝对值的不等式约束重表述方法,处理状态和动作变量中的仿射约束。
  • 采用参数化搜索空间,通过缓冲区大小平衡保守性(鲁棒性)与遗憾性能。
  • 推导关键矩阵的弗罗贝尼乌斯范数和梯度范数的理论界,以建立遗憾与可行性保证。

实验结果

研究问题

  • RQ1在线控制算法能否在有界对抗性扰动下实现次线性策略遗憾,同时保证硬约束满足?
  • RQ2在具有仿射约束的在线控制中,如何形式化表征并控制约束鲁棒性与遗憾性能之间的权衡?
  • RQ3如何设计最优缓冲区,以确保约束满足而不过度限制可行动作空间?

主要发现

  • 当缓冲区参数选择得当时,OGD-BZ 确保所有时间步的状态和动作约束均被满足,无论扰动是否受限于 $\bar{w}$。
  • 在适当的算法参数和假设下,OGD-BZ 的策略遗憾被限制在 $\tilde{O}(\sqrt{T})$,该值在时域长度 $T$ 上为次线性。
  • 遗憾界依赖于系统维度和扰动界,尽管 $\delta_1$ 与 $\bar{w}$ 呈反比关系,但 $L\delta_1$ 仍保持关于 $\bar{w}$ 的线性关系,原因在于梯度界 $G_f$ 的二次缩放。
  • 该算法显式地在约束鲁棒性与遗憾性能之间进行权衡:更大的缓冲区可提升约束满足能力,但会增加遗憾;反之亦然。
  • 理论分析表明,OGD-BZ 的可行集包含于一个松弛约束集 $\Gamma_\epsilon$ 内,且最小约束违反裕量被下界 $\epsilon_*$ 所限制。
  • 海森类似矩阵 $\bm{M}$ 以及对偶变量 $\bm{Y}^x, \bm{Y}^u, \bm{Z}$ 的弗罗贝尼乌斯范数被限制在 $\delta_1 = \Theta(\sqrt{mn} + \sqrt{k_c})$,该界对遗憾界有贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。