Skip to main content
QUICK REVIEW

[论文解读] Data-Driven Chance Constrained Control using Kernel Distribution Embeddings

Adam J. Thorpe, Thomas Lew|arXiv (Cornell University)|Feb 8, 2022
Gaussian Processes and Bayesian Inference被引用 5
一句话总结

本文提出了一种基于数据的方法,利用核分布嵌入求解联合机会约束最优控制问题,实现了无需假设系统动态或不确定性分布的无模型、高效计算随机控制策略。通过将状态轨迹分布嵌入再生核希尔伯特空间(RKHS),该方法将问题重新表述为关于控制参数的可处理线性规划,成功处理了具有非凸约束的非线性、非马尔可夫系统仿真。

ABSTRACT

We present a data-driven algorithm for efficiently computing stochastic control policies for general joint chance constrained optimal control problems. Our approach leverages the theory of kernel distribution embeddings, which allows representing expectation operators as inner products in a reproducing kernel Hilbert space. This framework enables approximately reformulating the original problem using a dataset of observed trajectories from the system without imposing prior assumptions on the parameterization of the system dynamics or the structure of the uncertainty. By optimizing over a finite subset of stochastic open-loop control trajectories, we relax the original problem to a linear program over the control parameters that can be efficiently solved using standard convex optimization techniques. We demonstrate our proposed approach in simulation on a system with nonlinear non-Markovian dynamics navigating in a cluttered environment.

研究动机与目标

  • 开发一种数据驱动的控制方法,以高效计算一般联合机会约束最优控制问题的随机策略。
  • 消除对系统动态或不确定性分布参数化模型的依赖。
  • 在不确定性下实现对整个轨迹的约束满足,即使在非马尔可夫和非线性系统中亦可。
  • 通过控制参数上的凸松弛化转化为线性规划,实现计算高效求解。
  • 在具有非凸约束和动态障碍物的复杂非线性、非马尔可夫系统上验证该方法。

提出的方法

  • 该方法使用核分布嵌入,将状态轨迹分布表示为再生核希尔伯特空间(RKHS)中的元素,从而实现系统随机动态的非参数化表示。
  • 通过观测轨迹数据集近似真实分布嵌入,避免对动态或不确定性的形式做出假设。
  • 通过将期望算子表示为RKHS中的内积,重新表述联合机会约束,实现可处理的近似。
  • 将原始难以求解的随机最优控制问题松弛为关于控制参数的线性规划,可通过标准凸优化求解。
  • 该方法计算随机开环控制策略,在不确定性下实现安全与性能的平衡。
  • 通过优化有限数量的随机开环轨迹,近似真实解,确保计算效率。

实验结果

研究问题

  • RQ1是否能够通过数据驱动方法在不假设系统动态或不确定性分布参数形式的前提下,计算联合机会约束问题的随机控制策略?
  • RQ2如何利用核分布嵌入,从观测数据中近似状态轨迹分布,从而实现高效优化?
  • RQ3基于控制参数的线性规划在非线性、非马尔可夫系统中,对非凸约束的控制是否能实现高概率的安全与可行性?
  • RQ4与依赖模型近似或保守松弛(如布尔不等式)的现有方法相比,该方法表现如何?
  • RQ5该方法能否通过数据采集主动学习更优的核函数或提升嵌入精度?

主要发现

  • 所提出的方法成功计算出满足目标水平联合机会约束的混合随机控制策略,在仿真中95%的轨迹可避开障碍物并成功抵达目标。
  • 当 δ = 0.05 时,算法选择的控制输入倾向于更安全的路径区域;增大 δ 会导致在风险更高的中间路径区域采取更激进的选择,符合预期。
  • 与 Ono(2016)的基线方法(假设线性动态)相比,该方法在相同非线性系统上将约束违反率从 10.2% 降低至接近零。
  • 该方法在高概率下实现约束满足的同时保持计算高效,因为问题被松弛为线性规划。
  • 该方法对非马尔可夫和非线性动态表现出鲁棒性,优于假设线性或马尔可夫性的模型化方法。
  • 结果证实,核分布嵌入能够实现对复杂轨迹分布的精确、无模型近似,从而在不确定性下实现安全控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。