QUICK REVIEW
[论文解读] The Nonstochastic Control Problem
Elad Hazan, Sham M. Kakade|arXiv (Cornell University)|Nov 27, 2019
Advanced Bandit Algorithms Research参考文献 26被引用 9
一句话总结
本文研究了在对抗性扰动和凸损失函数下,未知线性动态系统中的非随机控制问题,提出了一种高效算法,实现了相对于事后最优线性策略的 $O(T^{2/3})$ 再次损失。该方法结合对抗性系统辨识与在线凸优化,即使在完全对抗性扰动下,也能恢复系统矩阵并自适应控制。
ABSTRACT
We consider the problem of controlling an unknown linear dynamical system in the presence of (nonstochastic) adversarial perturbations and adversarial convex loss functions. In contrast to classical control, the a priori determination of an optimal controller here is hindered by the latter's dependence on the yet unknown perturbations and costs. Instead, we measure regret against an optimal linear policy in hindsight, and give the first efficient algorithm that guarantees a sublinear regret bound, scaling as T^{2/3}, in this setting.
研究动机与目标
- 解决在存在对抗性、非随机扰动且系统动态未知情况下的鲁棒控制问题。
- 定义一种新型控制框架——非随机控制,其中再次损失以事后最优线性策略为基准。
- 设计一种高效算法,在未预先知晓系统矩阵 $A$、$B$ 或扰动 $w_t$ 的情况下,实现次线性再次损失。
- 解决在对抗性噪声下系统辨识的开放问题,该问题此前在标准最小二乘法假设下不可行。
提出的方法
- 提出一种新型控制框架,学习者在线选择控制输入 $u_t$,以最小化相对于事后最优线性策略的再次损失。
- 采用对抗性系统辨识方法,从受对抗性扰动影响的状态轨迹中恢复系统矩阵 $A$ 和 $B$。
- 使用形式为 $u_t = -\mathbb{K}x_t + \eta_t$ 的控制输入,其中 $\eta_t$ 为零均值随机向量,以确保系统稳定性并支持矩量恢复。
- 应用矩阵集中不等式(矩阵 Azuma)从观测到的状态-控制对中估计矩量 $(A')^j B$。
- 利用线性系统的扰动分析,基于矩量估计误差,对恢复的矩阵 $\hat{A}, \hat{B}$ 的误差进行上界估计。
- 将在线凸优化应用于估计的系统动态,以生成具有次线性再次损失的自适应控制。
实验结果
研究问题
- RQ1当系统动态和扰动均为对抗性时,是否能在未知线性系统控制中实现次线性再次损失?
- RQ2在无 i.i.d. 噪声假设下,是否能够准确识别系统矩阵 $A$ 和 $B$,即使在对抗性扰动下?
- RQ3能否设计一种高效算法,在对抗性代价函数和未知动态条件下,与事后最优线性策略竞争?
- RQ4再次损失界是否随时间 $T$ 亚线性增长?若是,其最优速率为何?
主要发现
- 所提算法实现了 $O(\textrm{poly}(\texttt{natural-parameters})T^{2/3})$ 的再次损失,相对于事后最优线性策略为次线性。
- 通过 $A^\prime = A - B\mathbb{K}$ 的矩量恢复实现系统辨识,误差界依赖于用于恢复的步数 $T_0$。
- 当 $T_0 = O(kmn^2\kappa^{10}\gamma^{-2}W^2\varepsilon_{A,B}^{-2}\log(kmn\delta^{-1}))$ 时,$A^\prime$ 和 $B$ 的恢复以高概率 $1-\delta$ 成立,其中 $\varepsilon_{A,B}$ 为目标误差。
- 在控制策略下,状态范数和控制范数分别有界于 $O(\kappa^3\gamma^{-1}W)$ 和 $O(\kappa^4\gamma^{-1}W)$。
- 该算法确保每时间步的代价偏差相对于最优策略有界于 $O(Gn\kappa^8\gamma^{-2}W^2)$。
- 再次损失界在主导项中与系统维度无关,仅随 $T^{2/3}$ 增长,这在已知复杂度界下为最优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。