Skip to main content
QUICK REVIEW

[论文解读] Safety-Aware Preference-Based Learning for Safety-Critical Control

Ryan K. Cosner, Maegan Tucker|arXiv (Cornell University)|Dec 15, 2021
Formal Methods in Verification被引用 5
一句话总结

本文提出了一种安全感知的基于偏好的学习框架,将安全感知的 LineCoSpar(SA-LineCoSPAR)与控制障碍函数(CBFs)相结合,以在机器人控制中平衡性能与安全性。通过利用用户偏好来调节 CBF 参数,该方法在仿真和硬件实验中均实现了高性能、安全的四足机器人导航,减少了保守性,同时保持了可证明的安全性保证。

ABSTRACT

Bringing dynamic robots into the wild requires a tenuous balance between performance and safety. Yet controllers designed to provide robust safety guarantees often result in conservative behavior, and tuning these controllers to find the ideal trade-off between performance and safety typically requires domain expertise or a carefully constructed reward function. This work presents a design paradigm for systematically achieving behaviors that balance performance and robust safety by integrating safety-aware Preference-Based Learning (PBL) with Control Barrier Functions (CBFs). Fusing these concepts -- safety-aware learning and safety-critical control -- gives a robust means to achieve safe behaviors on complex robotic systems in practice. We demonstrate the capability of this design paradigm to achieve safe and performant perception-based autonomous operation of a quadrupedal robot both in simulation and experimentally on hardware.

研究动机与目标

  • 为解决在安全关键型机器人系统中平衡性能与安全性的挑战,传统基于 CBF 的控制器往往过于保守。
  • 通过使用用户偏好指导控制器参数选择,减少对专家调校奖励函数或定性评估的依赖。
  • 开发一种方法,在避免过度保守行为的同时,保持可证明的安全性保证。
  • 通过仅使用序数反馈(例如,“动作 A 优于 B”)实现实时、交互式的安全关键控制器调优。
  • 在仿真和真实世界环境中(包括户外环境)对四足机器人进行框架验证。

提出的方法

  • 提出安全感知的 LineCoSpar(SA-LineCoSpar),一种将安全约束融入高维参数空间偏好学习的贝叶斯优化算法。
  • 集成测量鲁棒 CBF(MR-CBFs)以处理传感器测量不确定性,以及输入到状态安全 CBF(ISSf-CBFs)以管理外部干扰。
  • 采用降阶多层安全关键控制架构,以保持参数形式下可证明的安全性,适合优化。
  • 采用 TR-OP(追踪鲁棒最优控制)框架,其名义控制器基于目标到达代价函数,通过安全函数的 0-超水平集实现障碍物避让。
  • 应用安全过滤器实时强制执行 CBF 约束,并通过输入饱和防止不可行性。
  • 使用 RealSense 相机进行感知,通过运动捕捉系统进行状态估计,用户反馈通过成对偏好和序数安全标签收集。

实验结果

研究问题

  • RQ1是否可以有效利用基于偏好的学习来调节基于 CBF 的安全过滤器,而无需预定义奖励函数?
  • RQ2安全感知的贝叶斯优化在保持可证明安全性的同时,如何减少基于 CBF 的控制器的保守性?
  • RQ3用户偏好在多大程度上可以引导复杂机器人系统中高性能、安全控制参数的发现?
  • RQ4所提出的框架在不同障碍物配置和环境(包括户外地形)中是否具有泛化能力?
  • RQ5MR-CBFs 和 ISSf-CBFs 的集成在真实世界部署中如何增强对测量误差和干扰不确定性的鲁棒性?

主要发现

  • SA-LineCoSpar 有效降低了控制器的保守性,使四足机器人能够在障碍物间以极少的安全违规实现前进。
  • 在 40 次迭代(包括户外测试)后找到的最终优选动作,在多种障碍物排列中实现了用户偏好的性能与安全平衡。
  • 在仿真中,该方法在存在感知误差(例如 y 方向 -0.1 m 偏移)的情况下仍能安全穿越障碍物,优于无法前进的保守基线方法。
  • 在实验室和户外环境中的硬件实验验证了所学策略在新障碍物配置下的泛化能力,如补充视频所示。
  • MR-CBFs 和 ISSf-CBFs 的集成实现了对测量误差和干扰的鲁棒性,在真实世界不确定性下保持了安全性。
  • 这是首次将基于偏好的学习应用于调节基于 CBF 的控制器,也是首次在统一、可学习的框架中结合 MR-CBFs 和 ISSf-CBFs。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。