Skip to main content
QUICK REVIEW

[논문 리뷰] Neurosymbolic Reinforcement Learning with Formally Verified Exploration

Greg Anderson, Abhinav Verma|arXiv (Cornell University)|2020. 09. 26.
Adversarial Robustness in Machine Learning참고 문헌 28인용 수 14
한 줄 요약

Revel은 신경망 정책 학습과 기호적 검증을 통해 연속적인 상태 및 행동 공간에서 형식적으로 검증된 탐색을 가능하게 하는 뉴로심볼릭 강화학습 프레임워크입니다. 안전성 실드를 기반으로 하되, 신경망을 직접 검증하지 않고 뉴로심볼릭 정책 위에서 미러 강하를 수행함으로써, 신경망 검증 없이도 안전성을 보장하며 기존의 제약 정책 최적화(CPO) 방법보다 성능 향상을 달성합니다.

ABSTRACT

We present Revel, a partially neural reinforcement learning (RL) framework for provably safe exploration in continuous state and action spaces. A key challenge for provably safe deep RL is that repeatedly verifying neural networks within a learning loop is computationally infeasible. We address this challenge using two policy classes: a general, neurosymbolic class with approximate gradients and a more restricted class of symbolic policies that allows efficient verification. Our learning algorithm is a mirror descent over policies: in each iteration, it safely lifts a symbolic policy into the neurosymbolic space, performs safe gradient updates to the resulting policy, and projects the updated policy into the safe symbolic subset, all without requiring explicit verification of neural networks. Our empirical results show that Revel enforces safe exploration in many scenarios in which Constrained Policy Optimization does not, and that it can discover policies that outperform those learned through prior approaches to verified exploration.

연구 동기 및 목표

  • 신경망 검증이 계산적으로 비현실적인 연속 제어 환경에서 형식적으로 검증된 탐색의 과제를 해결하기 위해.
  • 현대적 정책 기반 강화학습 방법을 유지하면서도 최악의 경우 안전성 보장을 확보하는 안전한 딥 강화학습을 가능하게 하기 위해.
  • 복잡한 환경에서 불필요하게 탐색을 제한하는 정적 안전 실드의 한계를 극복하기 위해.
  • 학습 중에 안전 모니터링 및 실드를 동적으로 업데이트할 수 있는 학습 프레임워크를 개발하기 위해.
  • 뉴로심볼릭 정책 표현 방식과 형식적 검증을 융합하여 안전성이 중요한 응용 분야에서 확장 가능한 안전한 강화학습을 구현하기 위해.

제안 방법

  • Revel은 뉴로심볼릭 정책 표현 방식을 사용합니다: 기능적 안전 실드와 정책 최적화를 위한 신경망 성분이 병합되어 있습니다.
  • 뉴로심볼릭 정책 공간에서의 미러 강하를 수행하며, 업데이트, 끌어올리기, 투영 단계를 번갈아 수행합니다.
  • 학습 알고리즘은 기호적 실드를 신경망 정책 공간으로 안전하게 끌어올리고, 근사적 기울기 업데이트를 적용한 후 다시 기호적 안전 공간으로 투영합니다.
  • 투영 단계는 신경망을 직접 검증하지 않고도 안전성을 유지하기 위해 이민 학습을 사용합니다.
  • 프레임워크는 기호적 실드를 검증하기 위한 형식적 검증기 의존하며, 이는 효율적으로 검증 가능하지만, 학습 중에는 신경망 성분은 검증되지 않은 채로 유지됩니다.
  • 검증을 위해 닫힌 형태의 최악의 경우 동역학 모델 $P^\#$ 를 가정하며, 이는 모든 행동이 적대적 환경 행동 조건에서도 안전하게 유지됨을 보장합니다.

실험 결과

연구 질문

  • RQ1깊은 신경망 정책를 사용하면서도 과도한 검증 비용 없이 연속 제어 과제에서 형식적으로 검증된 탐색을 달성할 수 있을까요?
  • RQ2학습 과정에서 안전 실드를 동적으로 개선할 수 있는 방법은 무엇이며, 정적 실드의 성능 제한을 피할 수 있을까요?
  • RQ3뉴로심볼릭 정책 표현 방식은 기울기 기반 학습의 효율성과 안전 제약의 효율적 검증을 동시에 달성할 수 있을까요?
  • RQ4뉴로심볼릭 정책 공간에서의 미러 강하 기반 학습 알고리즘이 기존의 제약 강화학습 방법보다 더 안전하고 높은 성능의 정책을 도출할 수 있을까요?
  • RQ5정적 또는 확률적 안전 접근 방식에 비해, 동적 실드 기반 접근 방식이 연속 행동 공간에서 탐색 효율성과 안전성 향상에 얼마나 기여할 수 있을까요?

주요 결과

  • Revel은 CPO가 신경망 검증이 불가능한 환경에서 안전하지 않은 행동을 유발함으로써 실패하는 연속 제어 환경에서도 안전한 탐색을 강제로 구현합니다.
  • 프레임워크는 특히 빠른 반응과 정밀한 제어가 요구되는 상황에서 정적 안전 실드를 사용한 정책보다 뛰어난 성능의 정책을 발견합니다.
  • 장애물2 및 acc(적응형 크루즈 컨트롤) 환경에서, Revel의 정책는 앞서 가는 차량과의 간격을 안전하게 줄이며 충돌을 피하는 반면, CPO 정책는 지연되거나 충분하지 않은 감속으로 인해 충돌합니다.
  • 신경망을 반복적으로 검증하지 않도록 기반으로 하여 효율적인 기호적 실드 검증을 통해 복잡한 도메인으로의 확장성을 확보합니다.
  • 실험 결과는 Revel의 동적 실드 메커니즘이 최악의 경우 안전성을 유지하면서도 더 공격적이고 효과적인 탐색을 가능하게 함을 보여줍니다.
  • 이론적 분석은 뉴로심볼릭 정책 공간에서의 미러 강하 기반 학습 알고리즘에 대해 수렴 보장을 확인합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.