[论文解读] Robust Regression for Safe Exploration in Control
本文提出了一种用于基于模型控制中安全探索的深度鲁棒回归框架,通过显式量化协变量偏移下的不确定性,实现可证明安全且信息丰富的数据采集。在快速无人机着陆和倒立摆控制等具有挑战性的非线性控制任务中,该方法优于基于高斯过程的方法,且调参更少。
We study the problem of safe learning and exploration in sequential control problems. The goal is to safely collect data samples from operating in an environment, in order to learn to achieve a challenging control goal (e.g., an agile maneuver close to a boundary). A central challenge in this setting is how to quantify uncertainty in order to choose provably-safe actions that allow us to collect informative data and reduce uncertainty, thereby achieving both improved controller safety and optimality. To address this challenge, we present a deep robust regression model that is trained to directly predict the uncertainty bounds for safe exploration. We derive generalization bounds for learning, and connect them with safety and stability bounds in control. We demonstrate empirically that our robust regression approach can outperform the conventional Gaussian process (GP) based safe exploration in settings where it is difficult to specify a good GP prior.
研究动机与目标
- 解决非线性控制系统中安全探索的挑战,即在提升模型精度的同时保持数据采集的安全性。
- 克服高斯过程在高维、非线性环境中因先验设定不佳而带来的局限性。
- 利用鲁棒回归量化在序列数据采集中常见的协变量偏移下动力学模型的不确定性。
- 将不确定性量化与控制理论相结合,推导轨迹跟踪的稳定性和安全边界。
- 实现高效、自适应的数据采集,平衡探索与安全性,且无需过多超参数调优。
提出的方法
- 使用包含残差项 d(q, ˙q) 的混合动力学模型来表述控制问题,该残差项表示未建模的动力学。
- 训练深度神经网络以在残差动力学上执行鲁棒回归,显式学习协变量偏移下的不确定性边界。
- 采用谱归一化和鲁棒估计技术,提升在分布偏移下的泛化能力和稳定性。
- 推导鲁棒回归模型的泛化与扰动边界,并将其与控制稳定性及跟踪误差相关联。
- 将不确定性估计集成到控制律中,通过复合变量 s = ˙q − ˙qr 确保收敛性,从而保证稳定性和安全性。
- 设计一种安全探索算法,从有限轨迹池中基于不确定性与安全约束选择轨迹,以最小化数据采集过程中的风险。
实验结果
研究问题
- RQ1在序列探索过程中数据分布发生偏移时,如何可靠地量化动力学模型中的不确定性?
- RQ2在先验信息差或错误指定的情况下,深度鲁棒回归能否在安全探索任务中优于高斯过程方法?
- RQ3如何将鲁棒回归所得的不确定性边界与控制稳定性及跟踪误差保证形式化关联?
- RQ4协变量偏移对控制中深度动力学模型的泛化能力和鲁棒性有何影响?
- RQ5基于鲁棒回归的方法能否在保持安全性的前提下,实现更具侵略性且信息更丰富的数据采集,特别是在非线性系统中?
主要发现
- 所提出的鲁棒回归方法在倒立摆轨迹跟踪和快速无人机着陆任务中均显著优于基于GP的方法。
- 与对核函数和先验选择敏感的GP方法相比,该方法显著减少了调参工作量。
- 从鲁棒回归模型推导出的泛化与扰动边界可直接转化为控制稳定性与跟踪误差边界。
- 该方法能有效处理分段学习中的协变量偏移,实现在整个轨迹上的可靠不确定性量化。
- 实验结果表明,即使在数据有限的情况下,该方法也能安全地探索系统边界(如快速无人机着陆),而不会导致崩溃。
- 在高维、非线性环境中,结合谱归一化的鲁棒回归在不确定性校准方面优于标准GP模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。