Skip to main content
QUICK REVIEW

[논문 리뷰] BarrierNet: A Safety-Guaranteed Layer for Neural Networks

Wei Xiao, Ramin Hasani|arXiv (Cornell University)|2021. 11. 22.
Adversarial Robustness in Machine Learning참고 문헌 43인용 수 7
한 줄 요약

BarrierNet는 소프트하고 적응형 고차수 제어 장벽 함수(HOCBF)를 사용하여 신경망 컨트롤러용 미분 가능하고 엔드 투 엔드 훈련 가능한 안전 레이어를 도입한다. 환경에 따라 달라지는 학습 가능한 매개변수를 가진 미분 가능한 2차 계획법에 HOCBF를 통합함으로써, 기존 CBF의 과도한 보수성은 줄이고 안전성을 보장하며 자율 주행 및 교통 통합과 같은 과제에서 경사 하강법을 통한 효과적인 훈련을 가능하게 한다.

ABSTRACT

This paper introduces differentiable higher-order control barrier functions (CBF) that are end-to-end trainable together with learning systems. CBFs are usually overly conservative, while guaranteeing safety. Here, we address their conservativeness by softening their definitions using environmental dependencies without loosing safety guarantees, and embed them into differentiable quadratic programs. These novel safety layers, termed a BarrierNet, can be used in conjunction with any neural network-based controller, and can be trained by gradient descent. BarrierNet allows the safety constraints of a neural controller be adaptable to changing environments. We evaluate them on a series of control problems such as traffic merging and robot navigations in 2D and 3D space, and demonstrate their effectiveness compared to state-of-the-art approaches.

연구 동기 및 목표

  • 불확실하거나 동적인 환경에서 기존 제어 장벽 함수(CBF)의 과도한 보수성을 해결하기 위해.
  • CBF를 미분 가능하고 훈련 가능한 것으로 만들음으로써 신경망 컨트롤러의 엔드 투 엔드 훈련과 안전 보장을 가능하게 하기 위해.
  • 장벽 함수의 학습 가능한 매개변수를 통해 환경 변화에 적응하는 모듈형이고 해석 가능한 안전 레이어를 개발하기 위해.
  • 실세계 제어 과제에서 안전성이 유지되면서도 성능과 적응성 향상을 달성할 수 있는지 검증하기 위해.

제안 방법

  • 클래스-𝐾 함수를 환경에 따라 달라지는 학습 가능한 페널티 함수 $ p_i(\bm{z}) $로 대체한 새로운 미분 가능한 HOCBF 공식을 제안하여 경계 조건을 부드럽게 하되 안전 보장은 유지한다.
  • HOCBF 제약 조건을 백프로파게이션을 통해 전파할 수 있는 미분 가능한 2차 계획법(QP)에 통합함으로써 전체 시스템의 경사 기반 훈련을 가능하게 한다.
  • 관측치 $ \bm{z} $ 와 상류 신경망 출력을 입력으로 받아 QP 최적화를 통해 안전한 제어 명령을 출력하는 학습 가능한 안전 레이어인 BarrierNet을 도입한다.
  • 기본 네트워크의 기준 제어 명령에서의 이탈을 최소화하면서 안전 제약 조건을 만족시키는 손실 함수를 사용하여 공동 훈련을 가능하게 한다.
  • 장벽 함수 $ b(\bm{x}) $ 의 고차수 도함수를 활용하며, $ L_f b(\bm{x}) $, $ L_f^2 b(\bm{x}) $, 및 $ L_g L_f b(\bm{x}) $ 는 안전 제약 조건을 정의하는 데 사용된다.
  • 백프로파게이션을 통해 페널티 함수 $ p_1(\bm{z}), p_2(\bm{z}) $ 를 훈련시켜 환경적 맥락에 따라 안전 마진을 자동으로 조정할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1불확실하거나 동적인 환경에서 안전 보장을 유지하면서도 과도한 보수성을 줄일 수 있는가?
  • RQ2HOCBF를 미분 가능하고 학습 가능한 구성 요소로 재구성하여 딥 신경망과의 엔드 투 엔드 훈련을 가능하게 할 수 있는가?
  • RQ3장벽 함수의 데이터 기반 매개변수화를 통해 안전 레이어가 환경 변화에 적응할 수 있는가?
  • RQ4제안된 BarrierNet이 주행 및 통합 과제에서 표준 신경망 컨트롤러와 기준 CBF 방법보다 안전성과 성능 측면에서 뛰어나게 성능을 발휘하는가?

주요 결과

  • BarrierNet은 2D 및 3D 로봇 주행 과제에서 충돌 회피를 성공적으로 보장하며, 그림 12b에서 안전한 궤적을 보여준다. 반면, 안전 제약 조건이 없는 표준 완전 연결(FC) 네트워크는 충돌을 일으킨다.
  • BarrierNet에서 장벽 함수 값 $ b(\bm{x}) $ 는 시간이 지남에 따라 항상 음이 아닌 상태를 유지하며 안전성을 확인한다. 반면, FC 기반 기준 모델에서는 이 값이 0 이하로 떨어지며 제약 위반이 발생함을 나타낸다.
  • BarrierNet이 학습한 페널티 함수 $ p_1(\bm{z}) $ 와 $ p_2(\bm{z}) $ 는 환경 입력에 따라 변화하며, 장애물에 가까워질수록 적응형 안전 마진이 작동하는 것을 보여준다.
  • 제어 명령에서 작은 추적 오차가 존재하더라도, BarrierNet 컨트롤러는 HOCBF 컨트롤러의 기준 궤적에 매우 가까운 궤적을 생성하여 안전한 행동을 효과적으로 학습하고 있음을 확인한다.
  • 그림 11에서 손실 및 페널티 함수 프로파일의 수렴을 통해 BarrierNet의 엔드 투 엔드 경사 하강법 훈련이 가능하고 안정적임을 입증한다.
  • 고정된 클래스-𝐾 함수를 학습 가능한 환경에 따라 달라지는 항목으로 대체함으로써 HOCBF의 보수성을 감소시켜 안전성을 유지하면서도 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.