Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Barrier Certificates: Towards Safe Reinforcement Learning with Zero Training-time Violations

Yuping Luo, Tengyu Ma|arXiv (Cornell University)|2021. 08. 04.
Adversarial Robustness in Machine Learning인용 수 8
한 줄 요약

이 논문은 공격적 훈련을 통해 안전을 보장하는 장벽 함수를 학습하고, 역동성 모델과 정책을 반복적으로 공훈련하는 CRABS를 제안한다. 이를 통해 안전한 제어 작업에서 훈련 시간 동안의 안전 위반을 완전히 제거한다. 이전 방법들이 수백 개의 안전하지 않은 상호작용을 필요로 하는 반면, CRABS는 저차원 연속 제어 작업에서 훈련 중 안전 위반을 0으로 줄였다.

ABSTRACT

Training-time safety violations have been a major concern when we deploy reinforcement learning algorithms in the real world. This paper explores the possibility of safe RL algorithms with zero training-time safety violations in the challenging setting where we are only given a safe but trivial-reward initial policy without any prior knowledge of the dynamics model and additional offline data. We propose an algorithm, Co-trained Barrier Certificate for Safe RL (CRABS), which iteratively learns barrier certificates, dynamics models, and policies. The barrier certificates, learned via adversarial training, ensure the policy's safety assuming calibrated learned dynamics model. We also add a regularization term to encourage larger certified regions to enable better exploration. Empirical simulations show that zero safety violations are already challenging for a suite of simple environments with only 2-4 dimensional state space, especially if high-reward policies have to visit regions near the safety boundary. Prior methods require hundreds of violations to achieve decent rewards on these tasks, whereas our proposed algorithms incur zero violations.

연구 동기 및 목표

  • 안전한 강화학습 알고리즘을 개발하여 안전한 응용 분야에서 훈련 시간 동안의 안전 위반을 완전히 제거한다.
  • 역동성 또는 오프라인 데이터에 대한 사전 지식이 없고, 안전하지만 보상이 낮은 초기 정책만 존재하는 도전적인 환경에서 작동한다.
  • 장벽 증명서, 정책, 역동성 모델을 반복적인 루프에서 함께 훈련하여 인증된 안전 영역을 확장하고 샘플 효율성을 향상시킨다.
  • 이전의 제약 정책 최적화 방법과 달리, 안전 제약 학습을 위해 안전하지 않은 궤적을 사용하지 않는다.
  • 수동으로 만든 장벽 함수를 초월하여 종단 간으로 장벽 함수를 학습함으로써 모델 기반 안전 강화학습을 확장한다.

제안 방법

  • CRABS는 반복적인 순환 과정에서 장벽 증명서, 정책, 역동성 모델을 함께 훈련한다.
  • 장벽 증명서는 상태 공간의 안전 영역을 인증하기 위해 공격적 훈련을 통해 학습되며, 정책이 안전 집합 내에 머무르도록 보장한다.
  • 알고리즘은 더 큰 인증된 영역을 장려하기 위한 정규화 항을 사용하여 안전 제약 내에서의 탐색을 향상시킨다.
  • 역동성 모델은 인증된 안전 영역에서만 수집된 데이터를 사용하여 정교화되어 정확도와 캘리브레이션을 향상시킨다.
  • 이 방법은 현재 및 과거 정책의 궤적에 특화된 장벽 증명서를 설계하여 관련성 있고 높은 보상 영역에 집중된 표현 능력을 확보한다.
  • 안전성은 학습된 장벽 함수의 초수준 집합 내에서만 환경 상호작용을 허용함으로써 보장되며, 이는 인증된 안전 영역을 정의한다.

실험 결과

연구 질문

  • RQ1역동성 또는 오프라인 데이터에 대한 사전 지식이 없이도 안전 강화학습에서 훈련 시간 동안의 안전 위반을 완전히 제거할 수 있는가?
  • RQ2장벽 증명서의 공격적 훈련이 이산화 없이 고차원 상태 공간에서의 안전 탐색을 가능하게 할 수 있는가?
  • RQ3장벽 증명서, 정책, 역동성 모델을 함께 훈련하는 것이 순차적 또는 독립적 훈련보다 안전성과 샘플 효율성에 어떻게 기여하는가?
  • RQ4학습된 장벽 증명서가 수동으로 만든 또는 사후에 적용된 안전 제약보다 안전성과 보상 측면에서 얼마나 뛰어나게 성능을 발휘할 수 있는가?
  • RQ5공동 학습을 통해 인증된 안전 영역을 반복적으로 확장하여 안전 경계 근처의 높은 보상 정책을 가능하게 할 수 있는가?

주요 결과

  • CRABS는 2~4차원 연속 제어 작업의 세트에서 훈련 중 안전 위반을 0으로 줄였다. 특히 안전 경계 근처에서 탐색이 필요한 환경에서도 성능을 발휘했다.
  • 90도 안전 제약 하에 막대의 각도를 최대화하는 Swing 환경에서, CRABS는 안전 위반 횟수를 수백 건에서 0으로 줄였다.
  • 이전 방법들은 2D 역전진 펜듈럼 환경에서 최소 80건의 안전하지 않은 궤적을 필요로 했지만, CRABS는 안전 위반을 전혀 경험하지 않았다.
  • 인증된 영역을 더 크게 만드는 데 기여하는 정규화 항은 탐색을 향상시키고 높은 보상 정책에 수렴하는 데 기여했다.
  • 정책과 역동성 모델과 함께 장벽 증명서를 함께 훈련함으로써 독립적 훈련보다 더 정확하고 캘리브레이션된 역동성 모델을 확보할 수 있었다.
  • 이 방법은 안전 및 비안전 궤적을 대조하는 데 의존하는 기존의 안전 강화학습 접근법보다 뛰어나며, 이는 본질적으로 일부 안전하지 않은 상호작용을 수반한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.