Skip to main content
QUICK REVIEW

[논문 리뷰] Context-Aware Safe Reinforcement Learning for Non-Stationary Environments

Baiming Chen, Zuxin Liu|arXiv (Cornell University)|2021. 01. 02.
Reinforcement Learning in Robotics참고 문헌 40인용 수 8
한 줄 요약

이 논문은 비정상적인 환경에서 빠르고 안전한 적응을 가능하게 하는 메타학습 프레임워크인 Context-Aware Safe Reinforcement Learning (CASRL)을 제안한다. 이는 맥락 인식 동역학 예측을 위한 확률적 잠재변수 모델과 불확실성 인식 제약 조건이 부여된 모델 예측 제어를 활용한다. CASRL은 사전 안전 제약 조건을 통합하고 드문 불안전 전이의 우선순위 샘플링을 통해 기존 방법들보다 뛰어난 안전성과 내성 확보를 달성한다.

ABSTRACT

Safety is a critical concern when deploying reinforcement learning agents for realistic tasks. Recently, safe reinforcement learning algorithms have been developed to optimize the agent's performance while avoiding violations of safety constraints. However, few studies have addressed the non-stationary disturbances in the environments, which may cause catastrophic outcomes. In this paper, we propose the context-aware safe reinforcement learning (CASRL) method, a meta-learning framework to realize safe adaptation in non-stationary environments. We use a probabilistic latent variable model to achieve fast inference of the posterior environment transition distribution given the context data. Safety constraints are then evaluated with uncertainty-aware trajectory sampling. The high cost of safety violations leads to the rareness of unsafe records in the dataset. We address this issue by enabling prioritized sampling during model training and formulating prior safety constraints with domain knowledge during constrained planning. The algorithm is evaluated in realistic safety-critical environments with non-stationary disturbances. Results show that the proposed algorithm significantly outperforms existing baselines in terms of safety and robustness.

연구 동기 및 목표

  • 시간에 따라 변화하는 외란이 존재하는 비정상적이고 안전이 핵심적인 환경에서 안전성과 적응성의 복잡한 얽힘 문제를 해결하기 위해.
  • 온라인 추론을 위한 맥락 인식 잠재변수 모델을 사용하여 예측되지 않은 환경 외란에 빠른 적응을 가능하게 하기 위해.
  • 데이터가 부족한 환경에서 도메인 지식을 사전 안전 제약 조건으로 통합하고 드문 불안전 전이의 우선순위 샘플링을 통해 안전성을 향상시키기 위해.
  • 고차원 작업에서 불확실성 하에 안전성을 유지하는 확장 가능한 위험 회피 제어 프레임워크를 개발하기 위해.

제안 방법

  • 역사적 맥락 데이터를 조건으로 삼는 맥락 인식 확률적 잠재변수 모델을 사용하여 환경 전이 분포를 추론함으로써 빠른 적응을 가능하게 한다.
  • 불확실성 인식 궤적 샘플링을 통한 제약 조건이 부여된 모델 예측 제어를 활용하여 계획 단계에서 안전성을 보장한다.
  • 도메인 지식에서 유도된 사전 안전 제약 조건을 통합하여 초기 학습 단계에서 보수적인 탐색을 이끌어낸다.
  • 모델 학습 중에 드문 불안전 궤적으로 인한 데이터 불균형을 완화하기 위해 우선순위 샘플링을 구현한다.
  • 다양한 비정상적 외란에 걸쳐 임의의 작업에 적응할 수 있도록 메타학습 원리를 활용한다.
  • 효율적이고 불확실성 인식 예측을 위한 온라인 베이지안 추론과 신경 과정 기반 동역학 모델(ANP)을 통합한다.

실험 결과

연구 질문

  • RQ1강화학습 에이전트는 시간에 따라 변화하는 외란이 존재하는 비정상적 환경에서 어떻게 안전하고 신속하게 적응할 수 있는가?
  • RQ2학습 데이터에서 불안전 궤적이 극히 드문 상황에서 안전성이 어떻게 보장될 수 있는가?
  • RQ3사전 도메인 지식과 우선순위 샘플링은 고차원적이고 안전이 핵심적인 작업에서 학습 효율성과 안전성을 얼마나 향상시킬 수 있는가?
  • RQ4맥락 인식 동역학 모델링은 표준 메타학습 또는 강건 강화학습 방법에 비해 안전성과 내성 면에서 어떻게 비교되는가?

주요 결과

  • CASRL은 기존 방법들에 비해 안전 위반 빈도를 크게 감소시켰으며, 특히 헬스케어 환경에서 고속도 인간 이동 시나리오에서 두드러진다.
  • 카트폴 스윙업 및 헬스케어 배달 작업 모두에서 CASRL은 MAML 및 기타 기준 방법들보다 위반 빈도가 낮으며, 예측 불가능한 외란 조건에서도 동일한 성능 유지를 보였다.
  • 우선순위 샘플링은 안전 영역 이외의 영역에서 성능 저하 없이 불안전 영역의 예측 정확도를 향상시켜 데이터 불균형 문제를 완화시켰다.
  • 사전 훈련 단계는 매우 중요하다: 사전 훈련 없이 CASRL을 적용한 경우 초기 학습 단계에서 위반 수가 급격히 증가하여 사전 안전 제약 조건의 가치를 입증했다.
  • CASRL은 전체 외란 공간에서 뛰어난 내성을 보였으며, 히트맵 분석을 통해 극단적 외란 조건에서도 제약 위반 수가 최소한으로 유지됨을 확인했다.
  • CASRL은 고차원 환경으로도 효과적으로 확장되며, 표준 메타학습 또는 강건 강화학습 접근 방식이 실패하는 상황에서도 안전성과 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.