Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Model-Based Reinforcement Learning Using Robust Control Barrier Functions.

Yousef Emam, Paul Glotfelter|arXiv (Cornell University)|2021. 10. 11.
Fault Detection and Control Systems참고 문헌 33인용 수 6
한 줄 요약

이 논문은 탐색 중 안전성을 보장하기 위해 모델 기반 강화학습 프레임워크 내에서 미분 가능한 강건한 제어 장벽 함수(RCBF) 레이어를 제안한다. RCBF 레이어를 학습 과정에 직접 통합함으로써, 실험적 평가에서 샘플 효율성을 향상시키면서도 안전성을 보장하는 방법을 제시한다.

ABSTRACT

Reinforcement Learning (RL) is effective in many scenarios. However, it typically requires the exploration of a sufficiently large number of state-action pairs, some of which may be unsafe. Consequently, its application to safety-critical systems remains a challenge. Towards this end, an increasingly common approach to address safety involves the addition of a safety layer that projects the RL actions onto a safe set of actions. In turn, a challenge for such frameworks is how to effectively couple RL with the safety layer to improve the learning performance. In the context of leveraging control barrier functions for safe RL training, prior work focuses on a restricted class of barrier functions and utilizes an auxiliary neural net to account for the effects of the safety layer which inherently results in an approximation. In this paper, we frame safety as a differentiable robust-control-barrier-function layer in a model-based RL framework. As such, this approach both ensures safety and effectively guides exploration during training resulting in increased sample efficiency as demonstrated in the experiments.

연구 동기 및 목표

  • 안전이 중요한 애플리케이션을 위한 강화학습에서의 불안전한 탐색 문제를 해결하기 위해.
  • 근사화 또는 보조 네트워크에 의존하는 이전의 안전 레이어의 한계를 극복하기 위해.
  • 미분 가능한 RCBF 설정을 사용하여 안전 제약 조건을 학습 과정에 직접 통합하기 위해.
  • 안전 인식 정책 최적화를 통해 탐색을 이끌어 샘플 효율성을 향상시키기 위해.
  • 안전 보장을 훼손하지 않으면서 강화학습과 안전 레이어 간의 효과적인 결합을 가능하게 하기 위해.

제안 방법

  • 모델 기반 강화학습 프레임워크 내에서 안전 제약 조건을 강제하는 미분 가능한 강건한 제어 장벽 함수(RCBF) 레이어를 제안한다.
  • 정책 최적화 과정 내부에 RCBF 레이어를 미분 가능한 구성 요소로 통합하여 엔드 투 엔드 학습을 가능하게 한다.
  • 모델의 불확실성과 시스템 동역학 내 외란을 고려하기 위해 강건한 제어 설정을 사용한다.
  • 모델 기반 접근을 활용하여 시스템 궤적을 예측하고, RCBF 레이어를 통해 안전한 동작 투영을 계산한다.
  • 보조 신경망을 피하기 위해 장벽 함수를 직접 학습 목표에 통합한다.
  • 제어 입력에 대한 안전 영역의 전방 불변성을 보장하는 수학적 설정을 통해 안전성을 확보한다.

실험 결과

연구 질문

  • RQ1모델 기반 강화학습의 탐색 단계에서 안전성이 어떻게 보장될 수 있는가?
  • RQ2근사화 네트워크에 의존하지 않고도, 미분 가능한 RCBF 레이어가 안전한 강화학습에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ3RCBF를 모델 기반 강화학습과 통합할 경우 수렴성과 안전 성능에 어떤 영향을 미치는가?
  • RQ4모델의 불확실성에 대한 강건성이 학습된 정책의 안정성과 안전성에 어떤 영향을 미치는가?
  • RQ5기존의 안전 레이어와 비교했을 때, 제안된 방법은 성능 및 안전 보장 측면에서 어떤가?

주요 결과

  • 제안된 방법은 강건한 제어 장벽 함수 제약 조건을 강제함으로써 학습 전 과정에서 안전성을 보장한다.
  • 미분 가능한 RCBF 레이어 덕분에 엔드 투 엔드 학습이 가능해져, 비미분 가능한 안전 레이어보다 샘플 효율성이 향상된다.
  • 보조 신경망이 필요 없어져 이전 방법에서 발생하는 근사 오류를 줄일 수 있다.
  • 실험 결과는 시뮬레이션 환경에서 향상된 학습 성능과 안전 준수를 입증한다.
  • RCBF를 모델 기반 강화학습 프레임워크에 통합함으로써 수렴 속도가 빨라지고 더 신뢰할 수 있는 안전 보장이 가능해진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.