[论文解读] Reinforcement Learning with Fast Stabilization in Linear Dynamical Systems
该论文提出 StabL,一种基于模型的强化学习算法,适用于可稳定化的线性动态系统,可在无需初始稳定控制器的情况下实现快速稳定,并达到 ˜O(√T) 的遗憾。通过结合乐观探索与各向同性扰动,StabL 在学习过程中确保系统稳定,同时保持对问题维度的多项式依赖,显著优于先前方法中呈指数级遗憾边界的局限。
In this work, we study model-based reinforcement learning (RL) in unknown stabilizable linear dynamical systems. When learning a dynamical system, one needs to stabilize the unknown dynamics in order to avoid system blow-ups. We propose an algorithm that certifies fast stabilization of the underlying system by effectively exploring the environment with an improved exploration strategy. We show that the proposed algorithm attains $ ilde{\mathcal{O}}(\sqrt{T})$ regret after $T$ time steps of agent-environment interaction. We also show that the regret of the proposed algorithm has only a polynomial dependence in the problem dimensions, which gives an exponential improvement over the prior methods. Our improved exploration method is simple, yet efficient, and it combines a sophisticated exploration policy in RL with an isotropic exploration strategy to achieve fast stabilization and improved regret. We empirically demonstrate that the proposed algorithm outperforms other popular methods in several adaptive control tasks.
研究动机与目标
- 解决在缺乏初始稳定控制器的情况下,对未知可稳定线性动态系统进行学习的挑战。
- 设计一种探索策略,确保在在线学习过程中实现快速系统稳定,同时最小化遗憾。
- 实现仅对系统维度呈多项式依赖的遗憾,克服先前工作中存在的指数依赖问题。
- 为一般可稳定 LQR 设置提供理论与实证上的稳定性与性能保证,而不仅限于可控制或收缩性情形。
- 在无人飞行器控制与不可控但可稳定系统中展示优越的实证性能。
提出的方法
- 提出 StabL 算法,将面对不确定性的乐观性(OFU)与各向同性探索相结合,以平衡探索与利用。
- 采用一种新颖的探索策略,通过衰减或固定的扰动主动探测系统动态,确保在学习初期的稳定性。
- 利用最小二乘估计构建系统参数的置信集,并应用稳定化证书验证候选控制器的稳定性。
- 采用随时间变化的探索调度,优先关注高不确定性、高影响的状态-动作对,以加速学习与稳定化。
- 引入一种稳定性认证机制,在部署前验证候选控制器是否能稳定系统。
- 结合基于模型的学习与遗憾最小化,确保代理在早期步骤中仅承担线性稳定成本,但总体遗憾为次线性。
实验结果
研究问题
- RQ1我们能否设计一种强化学习算法,在无需初始稳定控制器的情况下,稳定未知的可稳定线性系统?
- RQ2我们能否在可稳定 LQR 中实现 ˜O(√T) 的遗憾,且仅对系统维度呈多项式依赖?
- RQ3改进的探索策略相较于基于 OFU 的方法,对稳定化速度与遗憾性能的影响如何?
- RQ4在先前方法失效的不可控但可稳定系统中,所提方法能否优于现有算法?
- RQ5在可稳定 LQR 中,早期探索成本与长期遗憾之间的权衡是什么?
主要发现
- StabL 实现了 ˜O(√T) 的遗憾,且仅对问题维度呈多项式依赖,相较于先前方法中指数级遗憾边界的设定,实现了指数级改进。
- 在无人飞行器控制任务中,StabL 在 200 个时间步后平均遗憾为 1.53 × 10⁵,优于 OFULQ(5.06 × 10⁷)与 CEC 变体。
- 在无人飞行器任务中,StabL 平均最大状态范数为 8.46 × 10¹,显著低于 OFULQ 的 5.61 × 10²,表明其具有更优的稳定性。
- 在一个不可控但可稳定系统中,StabL 平均遗憾为 1.68 × 10⁶,而 OFULQ 遭受灾难性失败,遗憾高达 5.20 × 10¹²。
- StabL 将最坏情况下的状态范数降低至 2.51 × 10²(最差 5%),而 OFULQ 为 6.35 × 10³,证实了其鲁棒性。
- 该算法在多次运行中表现出稳定性能,遗憾与状态范数的方差较低,如结果中的四分位标准差带所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。