Skip to main content
QUICK REVIEW

[논문 리뷰] Provably Correct Training of Neural Network Controllers Using Reachability Analysis

Xiaowu Sun, Yasser Shoukry|arXiv (Cornell University)|2021. 02. 22.
Adversarial Robustness in Machine Learning참고 문헌 46인용 수 4
한 줄 요약

이 논문은 도달 가능성 분석과 새로운 가중치 투영 연산자를 조합하여, 증명 가능하고 안전한 및 생존성 보장이 있는 ReLU 신경망 컨트롤러를 훈련하는 프레임워크를 제안한다. 이 프레임워크는 유한 상태 추상 모델을 구성하여 안전성과 생존성 조건을 만족하는 연속적인 조각별 애파인(Continuous Piece-Wise Affine, CPWA) 함수를 식별하고, 훈련 중에 투영을 통해 이를 강제함으로써 사후 검증이나 런타임 모니터링 없이도 정확성을 보장한다.

ABSTRACT

In this paper, we consider the problem of training neural network (NN) controllers for nonlinear dynamical systems that are guaranteed to satisfy safety and liveness (e.g., reach-avoid) properties. Our approach is to combine model-based design methodologies for dynamical systems with data-driven approaches to achieve this target. We confine our attention to NNs with Rectifier Linear Unit (ReLU) nonlinearity which are known to represent Continuous Piece-Wise Affine (CPWA) functions. Given a mathematical model of the dynamical system, we compute a finite-state abstract model that captures the closed-loop behavior under all possible CPWA controllers. Using this finite-state abstract model, our framework identifies a family of CPWA functions guaranteed to satisfy the safety requirements. We augment the learning algorithm with a NN weight projection operator during training that enforces the resulting NN to represent a CPWA function from the provably safe family of CPWA functions. Moreover, the proposed framework uses the finite-state abstract model to identify candidate CPWA functions that may satisfy the liveness properties. Using such candidate CPWA functions, the proposed framework biases the NN training to achieve the liveness specification. We show the efficacy of the proposed framework both in simulation and on an actual robotic vehicle.

연구 동기 및 목표

  • 안전 기반 사이버-물리 시스템에 대한 데이터 기반 신경망 컨트롤러에서 공식적인 안전성 및 신뢰성 보장을 부족한 문제를 해결하기 위해.
  • 사후 검증이나 런타임 모니터링에 의존하지 않고도 신경망 컨트롤러가 안전성과 생존성 성질을 모두 만족하도록 보장하는 훈련 프레임워크를 개발하기 위해.
  • 모델 기반의 도달 가능성 분석과 데이터 기반 훈련을 통합하여 학습 과정을 증명 가능한 컨트롤러로 이끌기 위해.
  • 로봇 플랫폼에 실질적인 구현을 가능하게 하고, 공식적인 정확성 보장을 제공하는 신경망 컨트롤러의 실전 적용을 가능하게 하기 위해.

제안 방법

  • 모든 가능한 연속적인 조각별 애파인(Continuous Piece-Wise Affine, CPWA) 컨트롤러 하에서의 피드백 루프 동작을 포괄하는 비선형 동적 시스템의 유한 상태 추상 모델을 구축한다.
  • 도달 가능성 분석을 사용하여 도달 가능한 집합을 계산하고, 모든 초기 조건 하에서 안전성을 보장하는 CPWA 함수의 가족을 식별한다.
  • 훈련 중에 도입된 새로운 신경망 가중치 투영 연산자를 통해 학습된 가중치가 증명 가능한 안전한 가족의 CPWA 함수들만 표현하도록 제약을 둔다.
  • 추상 모델을 활용해 생존성 성질을 만족할 수 있는 후보 CPWA 함수를 식별하고, 이를 순위 매기며 훈련 과정에 이를 반영하여 편향을 주는 방식을 사용한다.
  • 프록시럴 정책 최적화(Proximal Policy Optimization, PPO)에 투영 연산자를 적용하여 PiCar 로봇 차량에 프레임워크를 적용하고, 안전성과 생존성을 만족하는 컨트롤러를 훈련시킨다.
  • 도달 가능한 집합 계산, 사후 그래프 구축, 국소 신경망 훈련 등의 핵심 컴포넌트를 병렬화하여 확장성을 확보한다.

실험 결과

연구 질문

  • RQ1데이터 기반의 신경망 컨트롤러 훈련 프레임워크가 사후 검증이나 런타임 모니터링 없이도 안전성과 생존성을 보장할 수 있는가?
  • RQ2도달 가능성 분석을 어떻게 활용하여 모든 가능한 ReLU 신경망 컨트롤러의 행동을 추상화하고, 안전한 CPWA 함수의 가족을 식별할 수 있는가?
  • RQ3가중치 투영 연산자가 훈련 중에 학습된 컨트롤러가 증명 가능한 안전한 CPWA 함수 집합 내에 머물도록 제약을 가하는 데 얼마나 효과적인가?
  • RQ4생존성은 투영만으로는 보장할 수 없으므로, 추상 모델을 어떻게 활용하여 훈련 과정을 생존성 만족 방향으로 이끌 수 있는가?
  • RQ5실제 로봇 제어 과제에서 시스템 차원과 분할의 정밀도에 비례하여 이 프레임워크의 확장성은 어느 정도인가?

주요 결과

  • 프레임워크는 레이스 트랙에서 여러 랩 동안 안전성 성질 φ_safety 를 만족하는 PiCar 로봇 차량을 위한 신경망 컨트롤러를 성공적으로 훈련시켰으며, 시뮬레이션과 실제 환경에서의 구현을 통해 이를 입증하였다.
  • 프레임워크의 실행 시간은 추상 상태 수와 컨트롤러 분할 수에 비례하여 선형적으로 증가하므로, 중간 정도의 분할 수준에선 양호한 확장성을 보였다.
  • 시스템 차원이 증가함에 따라 추상 상태 수와 실행 시간은 지수적으로 증가하지만, 프레임워크는 10차원 시스템에 대해서도 사후 그래프 구축을 10,000초 이내(약 2.7시간)에 수행할 수 있었다.
  • 온라인 모니터링, 예측 필터, 장벽 함수, 또는 사후 훈련 공식 검증 없이도 증명 가능한 정확한 컨트롤러를 달성하였다.
  • 가중치 투영 연산자가 효과적으로 신경망이 안전한 가족의 CPWA 함수들만 표현하도록 제약을 둠으로써, 건설적으로 안전성을 보장하였다.
  • 추상 모델 기반 후보 순위 매기기와 훈련 편향 기법을 활용하여, 투영만으로는 생존성을 보장할 수 없음에도 불구하고 생존성 조건을 만족하는 컨트롤러로의 수렴을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.