Skip to main content
QUICK REVIEW

[论文解读] Abstraction-based branch and bound approach to Q-learning for hybrid optimal control

Benoît Legat, Raphaël M. Jungers|arXiv (Cornell University)|Nov 22, 2020
Advanced Control Systems Optimization被引用 5
一句话总结

本文提出了一种基于抽象的分支定界算法,将Q-learning与拉格朗日对偶性相结合,以求解混合系统中的有限时域最优控制问题。通过利用交替模拟关系构建类似贝尔曼方程的Q函数,并借助MPC引导的轨迹对Q函数进行精炼,该方法显著减少了搜索树规模——在数值实验中实现了超过100,000倍的剪枝效果——即使在NP难问题背景下,仍能实现高效的在线控制。

ABSTRACT

In this paper, we design a theoretical framework allowing to apply model predictive control on hybrid systems. For this, we develop a theory of approximate dynamic programming by leveraging the concept of alternating simulation. We show how to combine these notions in a branch and bound algorithm that can further refine the Q-functions using Lagrangian duality. We illustrate the approach on a numerical example.

研究动机与目标

  • 为解决由于离散控制选择数量呈指数增长而导致的混合系统最优控制问题计算不可行性。
  • 通过将近似动态规划与分支定界相结合,开发一种可扩展、具备实时处理能力的有限时域最优控制方法。
  • 利用基于系统动力学粗略抽象导出的类似贝尔曼方程的Q函数,实现对搜索树的有效剪枝。
  • 通过模型预测控制(MPC)找到的可行轨迹,迭代精炼Q函数,提升相关状态空间区域的近似精度。
  • 在多个问题实例之间泛化并整合学习到的Q函数知识,以提升在新且相似的控制问题上的性能。

提出的方法

  • 利用粗略抽象与原始混合系统之间的交替模拟关系,推导出目标集上的李雅普诺夫函数和类似贝尔曼方程的Q函数。
  • 构建一种分支定界算法,利用这些Q函数作为下界,在搜索树中剪除次优分支。
  • 算法在前向传递(使用MPC寻找可行轨迹)与后向传递(利用拉格朗日对偶性沿这些轨迹精炼Q函数)之间交替进行。
  • 通过沿计算轨迹的最优控制解生成的割线,迭代更新Q函数,从而随时间逐步提高下界质量。
  • 利用混合整数二次规划(MIQP)的弱对偶性,生成有效割线,以收紧最优代价的下界。
  • 该方法具备跨问题实例的泛化能力:在某一实例上学习到的Q函数能显著减少相似问题的迭代次数,多实例联合学习可实现最大剪枝效果。

实验结果

研究问题

  • RQ1能否基于粗略系统模型导出的基于抽象的Q函数,有效剪枝混合最优控制分支定界算法中的搜索空间?
  • RQ2MPC引导的轨迹生成在多大程度上提升了学习到的Q函数在实时控制场景下的准确性和实用性?
  • RQ3在某一问题实例上学习到的Q函数在多大程度上可泛化并重用于加速求解相似的最优控制问题?
  • RQ4通过拉格朗日对偶性迭代精炼Q函数,对分支定界算法的收敛速度和解质量有何影响?
  • RQ5即使抽象较为粗糙,基于抽象的类似贝尔曼方程的函数是否仍能提供足够的剪枝效果,从而实现可扩展的在线控制?

主要发现

  • 基于粗略抽象导出的类似贝尔曼方程的Q函数,使某一实例的分支定界迭代次数从9,388,410次减少至85次,降幅超过100,000倍。
  • 在第二个实例中,该方法实现了10,000倍的迭代次数减少,表明即使抽象较为粗糙,仍能实现显著剪枝。
  • 通过在早期迭代中找到的轨迹学习Q函数,进一步减少了迭代次数:在结合两个实例的知识后,迭代次数从85次降至747次。
  • 在某一实例上学习到的Q函数可良好泛化至另一实例,当应用于不同初始状态时,迭代次数从880次降至761次,显示出强大的可迁移性。
  • 结合多个问题实例学习到的Q函数表现最佳,仅需747次迭代——证明了知识重用与协同效应的有效性。
  • 该方法通过仅在相关轨迹上精炼Q函数,避免对全状态空间进行近似,成功平衡了计算可行性与解的质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。