[논문 리뷰] Verification of Neural Network Control Policy Under Persistent Adversarial Perturbation
이 논문은 정적 신경망 인증 도구와 강건 제어 이론을 융합하여 지속적인 $ε$-유계 $ℓ_{\infty}$ 적대적 편향 하에서 신경망 제어 정책을 검증하는 새로운 프레임워크를 제안한다. 이는 제어 정책의 리프시츠 연속성 또는 미분 가능성 조건을 필요로 하지 않으며, 담금질된 제어 과제에서 기존 리프시츠 기반 방법보다 5배 더 높은 인증 경계를 달성하는 알고리즘을 도입한다.
Deep neural networks are known to be fragile to small adversarial perturbations. This issue becomes more critical when a neural network is interconnected with a physical system in a closed loop. In this paper, we show how to combine recent works on neural network certification tools (which are mainly used in static settings such as image classification) with robust control theory to certify a neural network policy in a control loop. Specifically, we give a sufficient condition and an algorithm to ensure that the closed loop state and control constraints are satisfied when the persistent adversarial perturbation is l-infinity norm bounded. Our method is based on finding a positively invariant set of the closed loop dynamical system, and thus we do not require the differentiability or the continuity of the neural network policy. Along with the verification result, we also develop an effective attack strategy for neural network control systems that outperforms exhaustive Monte-Carlo search significantly. We show that our certification algorithm works well on learned models and achieves 5 times better result than the traditional Lipschitz-based method to certify the robustness of a neural network policy on a cart pole control problem.
연구 동기 및 목표
- 폐쇄 루프 시스템에서 지속적인 적대적 편향에 노출된 신경망 제어 정책의 심각한 안전 문제를 해결하기 위해.
- 원래 이미지 분류에 설계된 정적 신경망 인증 도구를 피드백 연결이 있는 동적 제어 환경으로 확장하기 위해.
- 기존 강건 제어 방법이 실패하는 비리프시츠 및 비연속 신경망 정책에 대해서도 작동하는 인증 프레임워크를 개발하기 위해.
- 모의 실험을 통해 발견되지 않는 취약점을 공격 알고리즘으로 밝혀내기 위해 수학적 검증의 필요성을 입증하기 위해.
- 시스템 동역학이 알려지지 않았거나, 불안정하거나 비선형일 경우에도 데이터 기반 모델 학습 및 불확실성 경계 설정을 통해 강건성 인증을 가능하게 하기 위해.
제안 방법
- 정적 신경망 인증 도구(예: [8–13])를 활용하여 $ℓ_{\infty}$-유계 편향 하에서 신경망 정책의 입력-출력 행동에 대한 날카운 대체 근사치를 계산한다.
- 인증된 입력-출력 맵을 강건 제어 이론과 융합하여 폐쇄 루프 동적 시스템의 양의 불변 집합을 계산한다.
- 노미널 선형 정수형(LTI) 모델 $Π$와 수집된 롤아웃에서 부트스트랩 샘플링을 통해 유도된 모델링 오차의 보수적 경계 $Δ$를 사용하여 불확실한 시스템 동역학을 표현한다.
- 불변 집합 원리를 적용하여, 인증된 안전 영역 내에서 시작하는 모든 궤적이 지속적인 적대적 입력 하에서도 유계로 유지됨을 보장한다.
- 기존의 포괄적 몬테카를로 시뮬레이션으로는 발견되지 않는 취약점을 발견하기 위해 새로운 $ℓ_{\infty}$-노름 지속적 공격 알고리즘을 적용한다.
- 알고리즘 1을 설계하여 불변 집합에 대한 볼록 최적화 문제를 해결함으로써 인증된 안전 영역을 계산하며, 이는 정책의 연속성 또는 미분 가능성 조건을 필요로 하지 않는다.
실험 결과
연구 질문
- RQ1정적 신경망 인증 도구는 지속적인 적대적 편향 하에서 폐쇄 루프 동적 시스템의 제어 정책을 효과적으로 검증하는 데 확장 가능한가?
- RQ2비리프시츠 또는 비연속 제어 동작이 존재하는 상황에서 신경망 정책의 강건성을 어떻게 인증할 수 있는가?
- RQ3수학적 인증 프레임워크는 포괄적 시뮬레이션 기반 방법이 실패하는 취약점을 탐지할 수 있는가?
- RQ4기존 리프시츠 기반 강건 제어 접근법에 비해 제안된 방법이 인증의 날카움 측면에서 얼마나 뛰어나게 성능을 발휘하는가?
- RQ5진짜 시스템 동역학이 알려지지 않았거나, 불안정하거나 비선형인 경우, 이 프레임워크는 얼마나 효과적인가?
주요 결과
- 제안된 인증 알고리즘이 카트폴 제어 문제에서 기존 리프시츠 기반 방법보다 5배 더 높은 강건성 경계를 달성하여 더 날카운 인증 성능을 입증한다.
- 이 프레임워크는 리프시츠 기반 방법이 실패하는 비리프시츠 및 비연속 신경망 정책(예: 양자화된 제어 출력을 갖는 정책)에 대해서도 안전성을 성공적으로 인증한다.
- 진짜 선형화된 모델과 비슷한 성능을 내기 위해 100개의 에피소드 데이터로 학습된 학습된 모델에 대해서도 이 방법은 높은 수준의 인증 성능을 달성한다.
- 개발된 $ℓ_{\infty}$ 공격 알고리즘은 기존의 포괄적 몬테카를로 시뮬레이션으로는 탐지할 수 없는 신경망 제어 시스템의 취약점을 발견한다.
- 시스템 동역학이 불안정하거나 비선형인 경우에도, 데이터 기반 방법으로 유도된 보수적인 모델 불확실성 경계 $Δ$가 계산된다면, 이 인증 프레임워크는 여전히 효과가 있다.
- 알고리즘 1이 계산한 불변 집합은 정책의 연속성 조건 없이도 지속적인 적대적 편향 하에서 폐쇄 루프 시스템의 엄밀한 안전 인증을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.