[论文解读] Improper Learning for Non-Stochastic Control
该论文提出了一种基于去噪观测的新型控制器参数化方法,并应用在线梯度下降,在部分观测的非随机控制中实现了次线性后悔。它首次建立了已知系统下的√T后悔界,以及未知系统下的T^{2/3}后悔界,并在半对抗性噪声下实现了最优的poly(log T)后悔,与所有稳定线性控制器竞争。
We consider the problem of controlling a possibly unknown linear dynamical system with adversarial perturbations, adversarially chosen convex loss functions, and partially observed states, known as non-stochastic control. We introduce a controller parametrization based on the denoised observations, and prove that applying online gradient descent to this parametrization yields a new controller which attains sublinear regret vs. a large class of closed-loop policies. In the fully-adversarial setting, our controller attains an optimal regret bound of $\sqrt{T}$-when the system is known, and, when combined with an initial stage of least-squares estimation, $T^{2/3}$ when the system is unknown; both yield the first sublinear regret for the partially observed setting. Our bounds are the first in the non-stochastic control setting that compete with \emph{all} stabilizing linear dynamical controllers, not just state feedback. Moreover, in the presence of semi-adversarial noise containing both stochastic and adversarial components, our controller attains the optimal regret bounds of $\mathrm{poly}(\log T)$ when the system is known, and $\sqrt{T}$ when unknown. To our knowledge, this gives the first end-to-end $\sqrt{T}$ regret for online Linear Quadratic Gaussian controller, and applies in a more general setting with adversarial losses and semi-adversarial noise.
研究动机与目标
- 解决具有对抗性动态、损失和部分状态观测的非随机控制问题,其中传统最优控制器无法预先计算。
- 开发一种与广泛稳定线性动态控制器类竞争的后悔最小化控制器,而不仅限于静态反馈策略。
- 统一并改进非随机控制领域的先前结果,扩展至同时包含随机和对抗性噪声的设置。
- 在系统未知的经典线性二次高斯(LQG)设置中实现紧密的后悔界,此前的工作缺乏√T后悔保证。
提出的方法
- 提出基于Youla参数化的控制器参数化方法,将系统重新表达为‘自然的y’——零控制下的观测值。
- 引入扰动响应控制(DRC)框架,这是一种基于去噪观测的稳定控制器的凸参数化方法。
- 对DRC参数化应用在线梯度下降,形成基于梯度下降的梯度响应控制器(DRC-GD)。
- 采用两阶段方法:对未知系统先进行最小二乘估计,随后在DRC空间中进行在线优化。
- 利用鞅集中不等式和次高斯尾部界,推导出在对抗性和半对抗性噪声下的高概率后悔界。
- 通过损失差值的递归分解以及对梯度和状态估计误差的精细控制,推导出后悔界。
实验结果
研究问题
- RQ1当系统动态未知时,能否在部分观测的非随机控制中实现次线性后悔?
- RQ2所提出的控制器是否在完全对抗性和半对抗性噪声设置下均实现最优后悔率?
- RQ3后悔界是否能与整个稳定线性动态控制器类竞争,而不仅限于状态反馈策略?
- RQ4在部分观测设置下,已知系统情形的√T后悔界是否紧致?
- RQ5当系统已知时,该框架是否能在半对抗性噪声下实现poly(log T)后悔?
主要发现
- DRC-GD控制器在完全对抗条件下对已知系统实现了Õ(√T)的后悔,该结果紧致且是部分观测设置下的首个此类边界。
- 对于未知系统,该方法实现了Õ(T^{2/3})的后悔,是该设置下首次实现的次线性后悔边界。
- 在半对抗性噪声(随机+对抗性)下,当系统已知时,控制器实现了poly(log T)的后悔;当系统未知时,实现了√T的后悔——两者均为最优。
- 后悔界与整个稳定线性动态控制器类竞争,该类远比以往考虑的静态反馈策略类更丰富。
- 该框架首次为未知系统下的在线线性二次高斯(LQG)控制提供了端到端的√T后悔边界。
- 结果可扩展至一般凸损失函数和对抗性扰动,展示了其鲁棒性与通用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。