[论文解读] Non-Stochastic Control with Bandit Feedback
该论文提出了首个针对具有bandit反馈的线性动态系统非随机控制的高效次线性后悔算法,其中仅能观测到标量损失值。通过引入一种具有记忆功能的新型bandit凸优化方法,该方法能够处理时变损失函数,并在系统已知和未知的情况下均实现Õ(poly(自然参数)T^{3/4})的后悔界。
We study the problem of controlling a linear dynamical system with adversarial perturbations where the only feedback available to the controller is the scalar loss, and the loss function itself is unknown. For this problem, with either a known or unknown system, we give an efficient sublinear regret algorithm. The main algorithmic difficulty is the dependence of the loss on past controls. To overcome this issue, we propose an efficient algorithm for the general setting of bandit convex optimization for loss functions with memory, which may be of independent interest.
研究动机与目标
- 解决在仅能获得标量bandit反馈、且损失函数未知的情况下,对线性动态系统进行控制的挑战。
- 克服损失函数依赖于过去控制动作(即具有记忆性)所带来的困难,这在零阶反馈设置中使得梯度估计变得复杂。
- 设计一种高效算法,在非随机控制框架下实现次线性后悔,即使系统动态未知亦可。
- 将现有的凸松弛化与系统辨识技术扩展至bandit反馈设置,从而实现在实际控制应用中的可行部署。
- 在多种损失函数和噪声模型(包括相关性和非i.i.d.扰动)下,验证所提方法的有效性。
提出的方法
- 提出一种新型的带记忆的bandit凸优化算法,旨在处理依赖于过去状态和控制动作的损失函数。
- 引入一种人工延迟机制,以解耦损失函数中的时间依赖性,从而在bandit反馈设置中实现无偏梯度估计。
- 结合[4]中的凸松弛技术与[16, 30]中的非随机系统辨识方法,实现实时估计系统动态与扰动。
- 采用基于梯度的优化方法,利用基于扰动的估计方法获得梯度,并适配损失函数中的记忆特性。
- 将bandit优化框架应用于扰动-动作控制器(DAC),该控制器通过引入过去扰动信息,对线性动态控制器(LDC)进行了泛化。
- 实施两阶段学习过程:首先通过在线估计(使用算法3或线性回归)识别系统动态,然后基于估计模型优化控制策略。
实验结果
研究问题
- RQ1当仅能获得标量bandit反馈时,是否能在非随机控制的线性系统中实现次线性后悔?
- RQ2在损失函数依赖于过去控制动作(即具有记忆性)的bandit设置中,如何实现有效的梯度估计?
- RQ3在对抗性扰动和未知系统动态下,所提算法的性能如何?
- RQ4在非i.i.d.噪声环境中,该算法与经典LQR及基于梯度的策略方法(如GPC)相比表现如何?
- RQ5当系统动态未知且必须在线估计时,是否仍能保持后悔界?
主要发现
- 所提算法在对抗性扰动和bandit反馈下,对已知和未知的线性动态系统均实现了Õ(poly(自然参数)T^{3/4})的后悔界。
- 在相关噪声环境(如正弦波和随机游走扰动)下,该方法优于经典线性二次调节器(LQR),因为LQR在此类场景下表现次优。
- 在使用衰减学习率时,该算法在i.i.d.高斯噪声下收敛至LQR解,验证了其在良性环境下的收敛一致性。
- 带记忆的bandit凸优化框架使得在零阶反馈下仍能有效学习,克服了时间相关损失依赖性的挑战。
- 通过算法3和线性回归进行系统辨识均能在未知动态设置下实现稳定学习,实验结果表明算法3性能更优。
- 该算法在多种损失函数(包括L2、L1、L∞和ReLU)下均保持优异性能,展示了对非光滑和非二次代价函数的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。