Skip to main content
QUICK REVIEW

[논문 리뷰] In-Distribution Barrier Functions: Self-Supervised Policy Filters that Avoid Out-of-Distribution States

Fernando Castañeda, Haruki Nishimura|arXiv (Cornell University)|2023. 01. 27.
Model Reduction and Neural Networks인용 수 5
한 줄 요약

이 논문은 시각 기반 로봇 시스템이 오프라인 안전 시범 데이터의 분포를 벗어나지 않도록 보장하기 위해 학습된 잠재 상태 표현을 활용하는 자기지도 학습 정책 필터링 방법인 내분포 장벽 함수(iDBF)를 제안한다. 동역학 모델이나 비안전 데이터가 필요 없이 고차원 시각 관측치에 대해 제어 장벽 함수(CBF)를 적응시킴으로써, iDBF는 최소한의 간섭으로써 시뮬레이션 작업에서 분포 외 행동과 충돌률을 크게 감소시킨다.

ABSTRACT

Learning-based control approaches have shown great promise in performing complex tasks directly from high-dimensional perception data for real robotic systems. Nonetheless, the learned controllers can behave unexpectedly if the trajectories of the system divert from the training data distribution, which can compromise safety. In this work, we propose a control filter that wraps any reference policy and effectively encourages the system to stay in-distribution with respect to offline-collected safe demonstrations. Our methodology is inspired by Control Barrier Functions (CBFs), which are model-based tools from the nonlinear control literature that can be used to construct minimally invasive safe policy filters. While existing methods based on CBFs require a known low-dimensional state representation, our proposed approach is directly applicable to systems that rely solely on high-dimensional visual observations by learning in a latent state-space. We demonstrate that our method is effective for two different visuomotor control tasks in simulation environments, including both top-down and egocentric view settings.

연구 동기 및 목표

  • 데이터 기반 시각 운동 제어에서 분포 이탈 문제를 해결하기 위해, 정책이 훈련 데이터에서 벗어나면 실패하는 문제를 다루는 것.
  • 시스템 동역학이나 비안전 시범 데이터에 대한 사전 지식이 없는 안전 필터를 개발하는 것.
  • 자기지도 학습을 통해 잠재 상태 공간에서 고차원 시각 관측치에 제어 장벽 함수(CBF)를 확장하는 것.
  • 잠재 공간의 내분포 영역으로 행동를 제약하여 최소한의 간섭으로 안전성을 유지하는 것.
  • 오직 오프라인 안전 시범 데이터만을 사용하여 실제 로봇 시스템에서 강건하고 분포 인식 제어를 가능하게 하는 것.

제안 방법

  • 대조적 자기지도 학습을 사용하여 고차원 RGB 관측치로부터 잠재 상태 공간 표현을 학습한다.
  • 오직 오프라인 안전 시범 데이터만을 사용하여 잠재 공간에서 제어 장벽 함수(CBF) 기반의 정책 필터를 훈련한다.
  • 훈련 데이터 분포의 지지 영역 내에 체류하도록 보장하는 장벽 조건을 도입한다.
  • 각 타임스텝에서 장벽 조건을 만족하는 최소 간섭 제어 동작을 계산하기 위해 2차 프ogram(Quadratic Program, QP)을 사용한다.
  • 안전 경로의 분포를 유지하도록 도와주는 대조적 학습 목표를 활용한다.
  • 시스템 동역학의 명시적 모델링이나 비안전 경로에의 액세스가 필요하지 않다.

실험 결과

연구 질문

  • RQ1명시적 동역학 모델이 없이도 고차원 시각 관측치에 대해 제어 장벽 함수를 효과적으로 적용할 수 있는가?
  • RQ2자기지도 학습 방법으로 오직 오프라인 안전 시범 데이터만을 사용해 분포 인식 안전 필터를 학습할 수 있는가?
  • RQ3잠재 공간에서 학습된 장벽 함수가 시각 운동 제어 작업에서 분포 외 행동을 크게 감소시킬 수 있는가?
  • RQ4기본 필터링 방법과 비교할 때 제안된 iDBF는 안전성과 간섭 비용 측면에서 어떻게 성능을 내는가?
  • RQ5시뮬레이션에서 다양한 시각적 시점(예: 정면 시점 대 비주관적 시점) 간에 일반화가 가능한가?

주요 결과

  • iDBF 방법은 로봇 주행 및 주행 시뮬레이션 작업 모두에서 충돌률을 근본적으로 낮추어, 참조 정책보다 뚜렷이 뛰어난 성능을 보였다.
  • 로봇 주행 작업에서 iDBF는 충돌률 0.0%를 달성했으며, 이는 비필터링 정책의 15.2%에 비해 높은 성능이다. 간섭은 최소한이었다.
  • 주행 시뮬레이션에서 iDBF는 비필터링 기준선의 충돌률 12.8%를 0.0%로 감소시켰으며, 높은 작업 성능도 유지했다.
  • BC 밀도 필터 및 앙상블 분산 필터 기준선과 비교해도 iDBF는 안전성 측면에서 뛰어나, 특히 제한적인 임계값을 사용하는 후자와도 비교해 우수한 성능을 보였다.
  • BC 밀도 필터는 낮은 충돌률 달성을 위해 높은 필터 간섭 비용을 지불했으며, 이는 과도한 필터링을 의미한다.
  • 모든 방법 중에서 iDBF는 누적 필터 간섭 비용이 가장 낮아, 참조 정책에 대한 간섭 최소화를 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.