Skip to main content
QUICK REVIEW

[论文解读] Approximate Robust Control of Uncertain Dynamical Systems

Edouard Leurent, Y. Blanco|arXiv (Cornell University)|Mar 1, 2019
Advanced Control Systems Optimization参考文献 22被引用 17
一句话总结

本文提出了两种在不确定非线性动力系统中近似鲁棒控制的可行方法:针对有限模糊集的基于采样的规划器,以及针对连续集的基于区间预测的保守松弛方法。这些方法通过最大化最坏情况性能,实现了自动驾驶中的安全且高性能控制,实验表明,尽管存在模型不确定性,鲁棒策略仍能实现接近最优(oracle)的性能。

ABSTRACT

This work studies the design of safe control policies for large-scale non-linear systems operating in uncertain environments. In such a case, the robust control framework is a principled approach to safety that aims to maximize the worst-case performance of a system. However, the resulting optimization problem is generally intractable for non-linear systems with continuous states. To overcome this issue, we introduce two tractable methods that are based either on sampling or on a conservative approximation of the robust objective. The proposed approaches are applied to the problem of autonomous driving.

研究动机与目标

  • 解决大规模非线性系统中因动力学不确定性而导致的传统鲁棒控制不可行的安全控制挑战。
  • 通过引入近似且计算高效的算法,克服连续非线性系统中精确鲁棒控制的不可行性。
  • 实现鲁棒策略学习,确保在模型不确定性下具备性能边界,这对自动驾驶等安全关键应用至关重要。
  • 开发适用于离散与连续模糊集的方法,支持混合不确定性结构。
  • 通过包含真实交通交互的高速公路驾驶模拟环境,展示方法的实际有效性。

提出的方法

  • 针对有限模糊集,采用一种乐观的基于采样的规划器(算法1),通过探索完整动作序列,提供简单遗憾的上界。
  • 针对连续模糊集,利用区间预测器构建鲁棒策略评估问题的保守松弛。
  • 将状态区间预测条件化于所规划的策略,以确保保守近似中的一致性与安全性。
  • 使用参数化确定性模型 $ s' = T_\theta(s,a) $,其中 $ \theta \in \Theta \subset \mathbb{R}^p $,且 $ \Theta $ 为表示不确定性的紧集。
  • 将鲁棒控制目标表述为 $ \max_\pi \min_T v^T_\pi $,即在模糊集中最大化最坏情况下的期望回报。
  • 将方法整合到包含自车控制与多智能体交通动力学(基于运动学与行为模型建模)的高速公路驾驶模拟环境中。

实验结果

研究问题

  • RQ1我们能否为具有连续状态和不确定动力学的非线性系统设计一种计算高效、近似的鲁棒控制方法?
  • RQ2当精确鲁棒控制不可行时,如何在模型不确定性下维持性能保证?
  • RQ3在连续模糊集下使用区间预测器进行鲁棒控制时,保守性与性能之间的权衡如何?
  • RQ4基于采样的规划能否在有限模糊集设置下有效近似鲁棒策略,并保证收敛?
  • RQ5在存在人类驾驶行为不确定性的现实场景中,鲁棒策略与名义策略及最优策略相比表现如何?

主要发现

  • 基于采样的规划器(算法1)实现了最坏情况回报 8.99,平均回报 10.78±0.34,接近最优策略的最坏情况 9.83 和平均回报 10.84±0.16。
  • 基于区间预测器的方法(算法2)实现了最坏情况回报 7.88,平均回报 10.73±0.61,在两项指标上均优于名义规划器。
  • 在离散模糊集设置下,鲁棒规划器显著优于名义规划器(最坏情况回报 2.09),同时接近最优性能。
  • 在连续模糊集设置下,鲁棒规划器(最坏情况回报 7.88)大幅优于名义规划器(最坏情况回报 1.99),证明了其对模型偏差的鲁棒性。
  • 两种方法均提供了性能边界:采样方法确保渐近一致性,而区间方法提供了真实策略性能的下界。
  • 结果证实,通过保守近似实现的鲁棒控制,可在模型知识不完善的情况下,实现不确定交通环境中的安全且高性能决策。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。