Skip to main content
QUICK REVIEW

[论文解读] Efficient Optimistic Exploration in Linear-Quadratic Regulators via Lagrangian Relaxation

Marc Abeille, Alessandro Lazaric|arXiv (Cornell University)|Jul 13, 2020
Advanced Bandit Algorithms Research被引用 8
一句话总结

该论文提出LagLQ,一种通过拉格朗日松弛重新表述乐观有限horizon控制问题的计算高效算法,用于线性二次调节器(LQRs)。它证明了强对偶性,并表明通过求解O(log(1/ϵ))个Riccati方程,可计算出ϵ-最优控制器,实现Õ(√T)的遗憾,且时间复杂度为多项式时间,使其成为首个具有最优遗憾保证的计算高效置信度基LQR算法。

ABSTRACT

We study the exploration-exploitation dilemma in the linear quadratic regulator (LQR) setting. Inspired by the extended value iteration algorithm used in optimistic algorithms for finite MDPs, we propose to relax the optimistic optimization of \ofulq and cast it into a constrained extit{extended} LQR problem, where an additional control variable implicitly selects the system dynamics within a confidence interval. We then move to the corresponding Lagrangian formulation for which we prove strong duality. As a result, we show that an $ε$-optimistic controller can be computed efficiently by solving at most $O\big(\log(1/ε)\big)$ Riccati equations. Finally, we prove that relaxing the original \ofu problem does not impact the learning performance, thus recovering the $ ilde{O}(\sqrt{T})$ regret of \ofulq. To the best of our knowledge, this is the first computationally efficient confidence-based algorithm for LQR with worst-case optimal regret guarantees.

研究动机与目标

  • 解决在具有最优遗憾保证的前提下,LQRs中置信度基探索缺乏计算高效算法的问题。
  • 通过将问题转化为带拉格朗日松弛的约束扩展LQR,实现LQRs中乐观控制器的高效计算。
  • 证明放松置信椭球约束不会降低遗憾性能,保持OFU-LQ的Õ(√T)遗憾边界。
  • 在拉格朗日公式中建立强对偶性,通过求解Riccati方程实现高效求解。
  • 提供一种实用且可扩展的算法,避免SDP方法(如OSLO)的高计算成本以及探索-然后-承诺策略的长初始化阶段。

提出的方法

  • 该方法放松了乐观有限horizon LQR问题中的置信椭球约束,将其转化为带额外控制变量的约束扩展LQR,该变量可选择置信区间内的动力学参数。
  • 对约束LQR问题应用拉格朗日松弛,将其转换为带有与置信约束相关联的对偶变量的正则化优化问题。
  • 证明了强对偶性,确保对偶问题的最优解可恢复原始约束问题的最优解。
  • 通过求解最多O(log(1/ϵ))个Riccati方程,计算出ϵ-最优且ϵ可行的控制器,利用对偶公式。
  • 该算法使用回退程序处理对偶解可能不满足原始约束的罕见边界情况,尽管实证结果表明这种情况极少触发。
  • 该方法设计支持惰性更新,从而最小化随时间推移的控制器重新计算次数。

实验结果

研究问题

  • RQ1能否以一种可高效计算的方式重述乐观有限horizon LQR问题,同时保持遗憾保证?
  • RQ2在OFU-LQR问题中放松置信椭球约束是否会影响遗憾性能?
  • RQ3拉格朗日松弛能否用于推导出LQRs中置信度基探索的计算高效算法?
  • RQ4在拉格朗日公式下,计算ϵ-最优控制器的计算复杂度是多少?
  • RQ5与现有高效方法(如CECCE和OSLO)相比,所提方法在遗憾和运行时间方面的性能如何?

主要发现

  • 所提出的拉格朗日松弛方法实现了强对偶性,确保对偶问题可恢复原始约束LQR问题的最优解。
  • 通过求解最多O(log(1/ϵ))个Riccati方程,可计算出ϵ-最优控制器,从而实现计算开销低的多项式时间算法。
  • 该算法的遗憾与OFU-LQ的Õ(√T)边界一致,证实放松置信约束不会降低学习性能。
  • 实证评估表明,即使在CECCE使用降低的噪声方差进行调优的情况下,LagLQ在遗憾方面仍优于CECCE,表明LagLQ的不确定性感知探索更具有效性。
  • LagLQ的实现极为高效,每次控制器计算仅需50–80毫秒,对于ϵ = 10⁻¹²的收敛约需35–40次迭代,且回退程序极少被调用。
  • 该方法避免了OSLO的长初始化阶段,否则其会退化为探索-然后-承诺策略,且相比SDP方法更具可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。