Skip to main content
QUICK REVIEW

[论文解读] Logarithmic Regret for Learning Linear Quadratic Regulators Efficiently

Asaf Cassel, Alon Cohen|arXiv (Cornell University)|Feb 19, 2020
Advanced Bandit Algorithms Research参考文献 32被引用 11
一句话总结

本文提出了针对线性二次调节器(LQR)的高效学习算法,在两种情形下实现了对数 regret:当仅状态转移矩阵 $A_\star$ 未知时,或当仅状态-动作矩阵 $B_\star$ 未知且最优策略非退化时。通过利用系统内在噪声进行探索,并采用贪心、多项式时间的算法,作者实现了 $O(\log^2 T)$ 的 regret,挑战了此前认为 $O(\sqrt{T})$ regret 是紧致下界的信念。

ABSTRACT

We consider the problem of learning in Linear Quadratic Control systems whose transition parameters are initially unknown. Recent results in this setting have demonstrated efficient learning algorithms with regret growing with the square root of the number of decision steps. We present new efficient algorithms that achieve, perhaps surprisingly, regret that scales only (poly)logarithmically with the number of steps in two scenarios: when only the state transition matrix $A$ is unknown, and when only the state-action transition matrix $B$ is unknown and the optimal policy satisfies a certain non-degeneracy condition. On the other hand, we give a lower bound that shows that when the latter condition is violated, square root regret is unavoidable.

研究动机与目标

  • 设计针对未知转移参数的 LQR 系统的高效学习算法,实现次根号 regret。
  • 研究在未知矩阵的特定结构假设下,LQR 中是否可实现多对数 regret。
  • 建立理论下界,表明当最优策略接近退化时,$O(\sqrt{T})$ regret 是不可避免的。
  • 证明 LQR 动力学中的强凸性和内在噪声可实现比典型 bandit 问题更快的收敛速率。

提出的方法

  • 算法采用‘面对不确定性时的乐观性’原则,指导未知参数空间中的探索。
  • 利用系统动力学中的内在噪声,实现高效探索,而无需显式探索奖励。
  • 从估计的系统参数中推导出贪心控制器,并通过强稳定性参数 $\kappa$ 和 $\gamma$ 推导出稳定性和性能边界。
  • 该方法依赖于利用矩阵范数和 Riccati 方程解的谱性质来界定代价偏差。
  • 关键技术工具包括矩阵集中不等式和基于 Lyapunov 方程与谱范数的稳定性分析。
  • 算法每步运行时间多项式,且通过在线最小二乘回归持续维护对 $A_\star$ 或 $B_\star$ 的估计。

实验结果

研究问题

  • RQ1当仅 $A_\star$ 未知时,是否可在 LQR 学习中实现对数 regret?
  • RQ2当仅 $B_\star$ 未知且最优策略非退化时,是否可能实现多对数 regret?
  • RQ3当最优策略接近退化时,LQR 中 regret 的根本极限是什么?
  • RQ4在 LQR 学习中,内在系统噪声能否替代显式探索策略?
  • RQ5$O(\sqrt{T})$ regret 是否在一般 LQR 学习中确实不可避免,还是存在结构条件可实现更快收敛速率?

主要发现

  • 当 $B_\star$ 已知而 $A_\star$ 未知时,算法利用内在噪声进行探索,实现了 $O(\log^2 T)$ regret。
  • 当 $A_\star$ 已知且最优策略 $K_\star$ 满秩时,算法以高效计算实现了 $O(\log^2 T)$ regret。
  • 下界结果表明,当 $B_\star$ 未知且 $K_\star$ 接近退化时,$\Omega(\sqrt{T})$ regret 是不可避免的,即使在单输入系统中也是如此。
  • 结果表明,LQR 中的强凸性和系统结构可实现比典型 bandit 问题更快的 regret 速率。
  • 所提出的算法计算高效,每时间步的运行时间在系统维度上为多项式时间。
  • 分析表明,$K$-稳定性参数 $\kappa$ 和 $\gamma$ 控制着估计误差与性能损失之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。