Skip to main content
QUICK REVIEW

[논문 리뷰] Enforcing robust control guarantees within neural network policies

Priya L. Donti, Melrose Roderick|arXiv (Cornell University)|2020. 11. 16.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 12
한 줄 요약

이 논문은 다양한 최적화 기반 투영 레이어를 통합함으로써 고전적 강건 제어 이론의 증명 가능하고 강건한 성능 보장을 딥 뉴럴 네트워크 정책에 통합하는 방법을 제안한다. 이 방법은 비선형이며 고성능의 제어기를 딥 강화학습을 통해 학습시키면서도 최악의 외란 상황에서도 안정성을 유지할 수 있게 하며, 평균 성능과 최악의 상황에서의 강건성 측면에서 기존의 전통적 강건 제어 및 비강건한 딥 강화학습 방법들을 모두 능가한다.

ABSTRACT

When designing controllers for safety-critical systems, practitioners often face a challenging tradeoff between robustness and performance. While robust control methods provide rigorous guarantees on system stability under certain worst-case disturbances, they often yield simple controllers that perform poorly in the average (non-worst) case. In contrast, nonlinear control methods trained using deep learning have achieved state-of-the-art performance on many control tasks, but often lack robustness guarantees. In this paper, we propose a technique that combines the strengths of these two approaches: constructing a generic nonlinear control policy class, parameterized by neural networks, that nonetheless enforces the same provable robustness criteria as robust control. Specifically, our approach entails integrating custom convex-optimization-based projection layers into a neural network-based policy. We demonstrate the power of this approach on several domains, improving in average-case performance over existing robust control methods and in worst-case stability over (non-robust) deep RL methods.

연구 동기 및 목표

  • 안전이 중요한 시스템을 위한 제어 정책에서 강건성과 성능 간의 상충 관계를 해결하기 위해.
  • 딥 뉴럴 네트워크 기반 제어기를 고전적 강건 제어 방법으로부터 증명 가능한 강건성 보장을 이관할 수 있도록 하기 위해.
  • 학습 가능한 비선형 정책 클래스를 개발하여 최악의 외부 자극 상황에서도 안정성을 유지하면서 평균 성능을 희생시키지 않기 위해.
  • 강건 제어 제약 조건을 만족시키기 위해 볼록 최적화 기반 투영 레이어를 신경망 정책에 통합하기 위해.
  • 다양한 제어 영역에서 제안된 방법의 효과성을 입증하기 위해, 카트폴, 큐드로터, 마이크로그리드 시스템을 포함한 다양한 분야에 적용하기 위해.

제안 방법

  • 기본 제어기로 명목상의 딥 뉴럴 네트워크 정책을 사용한다.
  • 네트워크 출력을 강건 제어 제약 조건을 만족하는 액션 집합으로 매핑하는 가분성 있는 볼록 최적화 기반 투영 레이어를 적용한다.
  • 선형 행렬 부등식(LMI) 또는 시스템 불확실성의 비선형 동적 포함(NLDI) 모델에서 유도된 조건을 통해 안정성을 강제한다.
  • 투영 레이어는 가분성으로 설계되어 있어 표준 딥 강화학습 알고리즘을 통한 엔드 투 엔드 학습이 가능하다.
  • H∞ 제어 및 선형 미분 포함(LDI) 모델을 포함한 다양한 강건 제어 프레임워크를 지원한다.
  • 다양한 시스템에 대해 동적 특성을 다각형 또는 노름 유계 선형화(PLDI/NLDI)로 근사함으로써 선형 및 비선형 시스템 모두에 적용된다.

실험 결과

연구 질문

  • RQ1딥 뉴럴 네트워크 정책이 평균 성능과 증명 가능한 최악의 상황에서의 강건성 모두를 달성하도록 학습시킬 수 있는가?
  • RQ2학습 가능성에 손상이 가지 않도록 비선형 데이터 기반 정책에 강건 제어 보장을 통합할 수 있는가?
  • RQ3다양한 최적화 기반 투영 레이어가 딥 강화학습 프레임워크 내에서 강건 제어의 안정성 기준을 얼마나 잘 강제할 수 있는가?
  • RQ4제안된 방법은 적대적인 외란 상황에서 기존의 전통적 강건 제어 및 비강건한 딥 강화학습 방법과 비교해 어떻게 성능을 냈는가?
  • RQ5이 방법은 비선형 및 시간에 따라 변화하는 시스템을 포함한 다양한 제어 작업에 일반화될 수 있는가?

주요 결과

  • 제안된 방법은 전통적인 강건 LQR와 같은 강건 제어 방법보다 평균 성능이 뛰어나면서도 최악의 외부 자극 상황에서도 안정성을 유지한다.
  • 카트폴 도메인에서, 비강건한 딥 강화학습 방법들이 불안정해지거나 손실이 크게 증가하는 상황에서도 본 방법은 안정성을 유지했다.
  • 큐드로터 및 마이크로그리드 도메인에서, 본 방법은 최악의 외부 자극 상황에서도 안정적인 성능을 보였으며, 비강건한 딥 강화학습 기반 방법보다 안정성과 평균 손실 측면에서 모두 뛰어난 성능을 보였다.
  • 가분성 있는 투영 레이어의 통합은 LMI 기반 안정성 조건을 통해 검증된 바와 같이, 증명 가능한 강건성을 유지하면서 엔드 투 엔드 학습을 가능하게 했다.
  • 수치적으로 유도된, 약간 더 느슨할 수 있지만 더 실용적인 불확실성 범위를 사용함으로써, 기존의 표준 NLDI 변환 방법보다 더 날카로운 강건성 범위를 달성했다.
  • 실험 결과는 본 방법이 평균 상황에서 Robust LQR의 성능을 뛰어나게 하면서도 최악의 상황에서의 안정성은 훼손하지 않았음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.