[论文解读] Certainty Equivalent Perception-Based Control
本文提出了一种基于确定性等价感知的控制框架,利用非参数核回归从噪声大、动态采样的传感器数据中学习逆感知映射。该框架建立了航路点跟踪子最优性在有限时间内的收敛速率,表明子最优性以 $ \sim (\sigma/T)^{1/(p+4)} $ 的速率衰减,其中 $ T $ 为采样次数,$ p $ 为测量子空间的维度。
In order to certify performance and safety, feedback control requires precise characterization of sensor errors. In this paper, we provide guarantees on such feedback systems when sensors are characterized by solving a supervised learning problem. We show a uniform error bound on nonparametric kernel regression under a dynamically-achievable dense sampling scheme. This allows for a finite-time convergence rate on the sub-optimality of using the regressor in closed-loop for waypoint tracking. We demonstrate our results in simulation with simplified unmanned aerial vehicle and autonomous driving examples.
研究动机与目标
- 为具有未建模非线性传感器的反馈控制系统提供性能与安全保证。
- 解决自主系统中传感器不确定性的问题,其中状态估计依赖于复杂且高维的观测数据。
- 分析学习感知映射所需的样本复杂度,以确保闭环控制系统实现有界的子最优性。
- 证明对测量子空间进行密集且动态可行的采样,可实现非参数回归的统一收敛。
- 在真实自主车辆和无人飞行器仿真中评估所学感知映射的闭环性能。
提出的方法
- 利用带有噪声的辅助传感器,监督对逆感知映射 $ h $ 的学习,该映射将观测 $ z $ 映射到状态子空间 $ Cx $。
- 使用非参数核回归(KRR)从通过动态可行密集采样方案收集的 $ T $ 个训练样本中估计 $ h $。
- 在假设逆映射连续且噪声有界的前提下,对回归估计施加统一的点态误差界。
- 推导出所学控制器与最优控制器之间子最优性差距的有限时间收敛速率,其缩放关系为 $ (\sigma/T)^{1/(p+4)} $。
- 应用确定性等价控制律,在线性输出反馈控制框架中将所学映射 $ \widehat{h}(z) $ 视为真实状态估计。
- 采用鲁棒控制公式,最小化在有界扰动和传感器噪声下与参考轨迹的最坏偏差。
实验结果
研究问题
- RQ1能否在闭环控制中使用学习型感知映射,并提供可证明的性能保证?
- RQ2当使用非参数回归器进行感知时,为确保航路点跟踪中子最优性的有界性,需要多少样本复杂度?
- RQ3对测量子空间进行密集且动态可行的采样,如何影响感知映射的统一收敛性?
- RQ4当训练数据稀疏或分布不佳时,非参数预测器(如NW、KRR)在闭环控制中的失效模式是什么?
- RQ5在数据稀疏条件下,SLAM等无监督或半监督方法是否优于监督非参数学习方法在感知控制中的表现?
主要发现
- 使用所学感知映射的确定性等价控制器的子最优性,以 $ \sim (\sigma/T)^{1/(p+4)} $ 的速率衰减,其中 $ \sigma $ 为噪声水平,$ T $ 为训练样本数。
- 在动态可行的密集采样方案下,建立了非参数核回归的统一点态误差界,从而实现鲁棒性保证。
- 当参考轨迹将系统引导至训练数据稀疏的区域时,闭环跟踪会失败,尤其对非参数预测器(如NW、KRR)而言。
- 基于SLAM的感知方法,通过利用未标记数据进行在线地图构建,相比监督非参数方法,在分布外区域表现出更强的鲁棒性。
- 只要采样方案能充分覆盖测量子空间,即使感知映射不完美,该方法也能确保系统稳定性和有界的子最优性。
- 在无人机和自动驾驶任务上的数值评估表明,密集采样与所学映射的结合可实现稳定且精确的航路点跟踪,而稀疏采样则导致不稳定和失败。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。