Skip to main content
QUICK REVIEW

[论文解读] Logarithmic Regret for Adversarial Online Control

Dylan J. Foster, Max Simchowitz|arXiv (Cornell University)|Feb 29, 2020
Advanced Bandit Algorithms Research参考文献 37被引用 22
一句话总结

本文提出Riccatitron,一种新型在线线性二次控制算法,适用于对抗性扰动,通过利用最优离线控制律的表征并将其问题转化为带有近似优势函数的延迟在线学习,实现了对数 regret。在系统动态和二次成本已知的情况下,该方法实现了 $Ó(\log^3 T)$ 的 regret,这是在完全对抗性序列下首次实现此类结果,且无需随机假设。

ABSTRACT

We introduce a new algorithm for online linear-quadratic control in a known system subject to adversarial disturbances. Existing regret bounds for this setting scale as $\sqrt{T}$ unless strong stochastic assumptions are imposed on the disturbance process. We give the first algorithm with logarithmic regret for arbitrary adversarial disturbance sequences, provided the state and control costs are given by known quadratic functions. Our algorithm and analysis use a characterization for the optimal offline control law to reduce the online control problem to (delayed) online learning with approximate advantage functions. Compared to previous techniques, our approach does not need to control movement costs for the iterates, leading to logarithmic regret.

研究动机与目标

  • 开发一种可证明高效的在线控制算法,在对抗性扰动存在时实现低 regret,即使扰动为最坏情况而非随机性。
  • 弥合现有 $Ó(\sqrt{T})$ regret 边界与对抗性在线控制中对数 regret 的理论可能性之间的差距。
  • 确立在在线线性控制中实现对数 regret 的条件,特别是当系统矩阵 $A$ 和 $B$ 已知时。
  • 通过使用近似优势函数重新表述问题,缓解在线控制中因不同策略访问不同状态轨迹而产生的轨迹不匹配问题。
  • 将框架扩展至更一般的基准,包括具有内部状态的控制器和追踪损失函数。

提出的方法

  • 通过利用黎卡提方程和系统的闭环动力学表征最优离线控制律,将在线控制问题转化为延迟在线学习问题。
  • 采用近似优势函数来建模当前策略与最优策略之间成本的差异,从而实现高效的 regret 最小化。
  • 该方法避免了控制迭代过程中策略更新的移动成本,这是与先前方法的关键区别,使得能够实现对数 regret 而非 $\sqrt{T}$。
  • 利用稳定性保证和系统矩阵及黎卡提解的算子范数界,控制时间步长间的误差传播。
  • 分析利用黎卡提迭代收敛至 $P_\infty$ 的收敛速率,界定了有限时域与无限时域最优策略之间的差异。
  • 采用经过仔细调节的正则化与稳定性阈值化方案,确保随时间累积误差有界,依赖于闭环系统的谱性质。

实验结果

研究问题

  • RQ1在扰动为完全对抗性而非随机或半对抗性时,是否可在在线线性二次控制中实现对数 regret?
  • RQ2对系统(如已知 $A$、$B$、二次成本)需要哪些结构性假设,才能实现对数 regret?
  • RQ3如何通过重新表述 regret 最小化问题来缓解动态在线控制中的轨迹不匹配问题?
  • RQ4是否可以在不施加持续激励或 i.i.d. 噪声假设的前提下,将 regret 边界改进至 $\sqrt{T}$ 以下?
  • RQ5最优离线控制律的结构在实现具有对数 regret 的高效在线学习中起到何种作用?

主要发现

  • 所提出的 Riccatitron 算法在系统动态和二次成本已知的条件下,对对抗性扰动实现了 $\mathcal{O}(\log^3 T)$ 的 regret。
  • 这是首个在完全对抗性设置下实现多对数 regret 的算法,且无需对扰动施加随机假设。
  • 即使扰动序列由对手自适应选择,该 regret 边界依然成立,表明其具有强大的鲁棒性。
  • 该方法避免了控制策略迭代过程中移动成本的需求,这是实现对数 regret 的关键因素,与先前方法形成鲜明对比。
  • 分析表明,当 $A$ 和 $B$ 已知时,对数 regret 是可能的;但当 $A$ 和 $B$ 未知时,即使在 i.i.d. 高斯噪声下,也不存在最小最大意义下的对数 regret。
  • 该算法可扩展至更一般的基准,包括具有内部状态的控制器和追踪损失函数,且保持类似的 regret 保证。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。