Skip to main content
QUICK REVIEW

[论文解读] In-Distribution Barrier Functions: Self-Supervised Policy Filters that Avoid Out-of-Distribution States

Fernando Castañeda, Haruki Nishimura|arXiv (Cornell University)|Jan 27, 2023
Model Reduction and Neural Networks被引用 5
一句话总结

该论文提出了一种分布内障碍函数(iDBF),一种基于自监督策略过滤的方法,利用学习到的潜在状态表示,使基于视觉的机器人系统保持在安全离线演示的分布范围内。通过在无需动力学模型或非安全数据的情况下,将控制障碍函数(CBF)适配到高维视觉观测中,iDBF 实现了最小干预,同时显著降低了模拟任务中的分布外行为和碰撞率。

ABSTRACT

Learning-based control approaches have shown great promise in performing complex tasks directly from high-dimensional perception data for real robotic systems. Nonetheless, the learned controllers can behave unexpectedly if the trajectories of the system divert from the training data distribution, which can compromise safety. In this work, we propose a control filter that wraps any reference policy and effectively encourages the system to stay in-distribution with respect to offline-collected safe demonstrations. Our methodology is inspired by Control Barrier Functions (CBFs), which are model-based tools from the nonlinear control literature that can be used to construct minimally invasive safe policy filters. While existing methods based on CBFs require a known low-dimensional state representation, our proposed approach is directly applicable to systems that rely solely on high-dimensional visual observations by learning in a latent state-space. We demonstrate that our method is effective for two different visuomotor control tasks in simulation environments, including both top-down and egocentric view settings.

研究动机与目标

  • 解决数据驱动视觉运动控制中的分布偏移问题,即当策略偏离训练数据时发生失效的问题。
  • 开发一种无需系统动力学先验知识或非安全演示的安全部件。
  • 通过在潜在状态空间中利用自监督学习,将控制障碍函数(CBF)扩展至高维视觉观测。
  • 通过将动作约束在潜在空间中的分布内区域,实现在保持安全的同时最小化干预。
  • 仅使用离线安全演示,实现真实机器人系统中鲁棒且具备分布感知能力的控制。

提出的方法

  • 使用对比自监督方法从高维RGB观测中学习潜在状态空间表示。
  • 在潜在空间中基于控制障碍函数(CBF)训练策略过滤器,仅使用离线安全演示。
  • 施加一个障碍条件,确保系统在潜在空间中保持在训练数据分布的支持区域内。
  • 在每个时间步使用二次规划(QP)计算满足障碍约束的最小干预控制动作。
  • 采用对比学习目标,促使潜在表示保留安全轨迹的分布特性。
  • 无需显式建模系统动力学或访问非安全轨迹。

实验结果

研究问题

  • RQ1在无需显式动力学模型的情况下,控制障碍函数能否有效应用于高维视觉观测?
  • RQ2自监督方法如何仅从离线安全演示中学习到具备分布感知能力的安全过滤器?
  • RQ3在潜在空间中学习到的障碍函数能否显著减少视觉运动控制任务中的分布外行为?
  • RQ4与基线过滤方法相比,所提出的iDBF在安全性和干预成本方面表现如何?
  • RQ5该方法在模拟环境中能否在不同视觉视角(如俯视图与第一视角)之间实现泛化?

主要发现

  • iDBF 方法在机器人导航和驾驶模拟任务中均将碰撞率降低至接近零,显著优于未过滤的参考策略。
  • 在机器人导航任务中,iDBF 的碰撞率为 0.0%,而未过滤策略为 15.2%,且干预极少。
  • 在驾驶模拟中,iDBF 将碰撞率从未过滤基线的 12.8% 降低至 0.0%,同时保持了较高的任务性能。
  • 即使在后者的阈值设置较为严格的情况下,iDBF 在安全性方面仍优于 BC 密度滤波器和集成方差滤波器基线方法。
  • BC 密度滤波器仅在付出极高滤波干预率的代价下才实现低碰撞率,表明其存在过度过滤问题。
  • iDBF 在所有方法中实现了最低的累积滤波干预率,表明其对参考策略的干扰最小。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。