Skip to main content
QUICK REVIEW

[논문 리뷰] Sim-to-Lab-to-Real: Safe Reinforcement Learning with Shielding and Generalization Guarantees

Kai–Chieh Hsu, Allen Z. Ren|arXiv (Cornell University)|2022. 01. 20.
Reinforcement Learning in Robotics인용 수 4
한 줄 요약

이 논문은 안전한 강화학습을 위한 Sim-to-Lab-to-Real 프레임워크를 제안한다. 이 프레임워크는 해밀토니안-자브리히-리치가비리티 분석과 PAC-Bayes 일반화 보장을 결합하여 실제 환경 배포 시 안전성과 성능을 보장한다. 이는 성능 정책과 안전 인지 백업 정책을 갖춘 이중 정책 설정을 사용하여 시뮬레이션 및 실험실 환경에서 안전한 탐색을 가능하게 하며, 예측 불가능한 실제 환경에 대한 안전성과 일반화의 확률적 증명을 제공한다.

ABSTRACT

Safety is a critical component of autonomous systems and remains a challenge for learning-based policies to be utilized in the real world. In particular, policies learned using reinforcement learning often fail to generalize to novel environments due to unsafe behavior. In this paper, we propose Sim-to-Lab-to-Real to bridge the reality gap with a probabilistically guaranteed safety-aware policy distribution. To improve safety, we apply a dual policy setup where a performance policy is trained using the cumulative task reward and a backup (safety) policy is trained by solving the Safety Bellman Equation based on Hamilton-Jacobi (HJ) reachability analysis. In Sim-to-Lab transfer, we apply a supervisory control scheme to shield unsafe actions during exploration; in Lab-to-Real transfer, we leverage the Probably Approximately Correct (PAC)-Bayes framework to provide lower bounds on the expected performance and safety of policies in unseen environments. Additionally, inheriting from the HJ reachability analysis, the bound accounts for the expectation over the worst-case safety in each environment. We empirically study the proposed framework for ego-vision navigation in two types of indoor environments with varying degrees of photorealism. We also demonstrate strong generalization performance through hardware experiments in real indoor spaces with a quadrupedal robot. See https://sites.google.com/princeton.edu/sim-to-lab-to-real for supplementary material.

연구 동기 및 목표

  • 시뮬레이션에서 실제 환경으로의 전이 과정에서 발생하는 '현실 격차'를 해소하기 위해 제어 가능한 중간 단계인 '실험실(Lab)' 훈련 단계를 도입한다.
  • HJ 도달 가능성 분석에서 유도된 백업 안전 정책을 통합하여 훈련 및 배포 과정에서의 안전성을 보장한다.
  • PAC-Bayes 이론을 활용해, 예측 불가능한 실제 환경에서 정책 성능과 안전성에 대한 확률적이고 분포에 종속되지 않는 보장을 제공한다.
  • 보호 장치와 통계적 경계를 조합하여 일반화를 인증함으로써 시뮬레이션과 실제 환경 간 격차를 해소한다.
  • 어린이가 있는 가정이나 동적인 실내 공간과 같은 안전이 중요한 환경에서의 신뢰할 수 있는 강화학습 정책 배포를 가능하게 한다.

제안 방법

  • 시뮬레이션에서 성능 정책(작업 보상 최적화)과 백업 안전 정책(안전 벨먼 방정식을 통해 HJ 도달 가능성 분석에 기반해 훈련)을 갖춘 이중 정책 시스템을 훈련한다.
  • 실험실 단계에서 보호 장치(셔터링)를 적용하여 안전 비평가 값이 임계값을 초과할 경우 성능 정책의 위험한 행동을 무효화한다.
  • PAC-Bayes 프레임워크를 활용해 최악의 환경 변동을 고려한 예상 성능과 안전성의 하한을 유도한다.
  • Sim-to-Lab 전이 과정에서 다양한 환경으로의 일반화를 가능하게 하기 위해 정책을 잠재 변수 분포에 조건화한다.
  • 실제 환경의 사진적 사실성과 역학을 반영한 현실적인 시뮬레이션 환경을 사용하여 실험실에서 정책 분포를 미세 조정한다.
  • 실제 로봇 역학과 카메라 자세를 모델링하기 위해 시스템 식별 기법을 사용하여 실험실 훈련의 정밀도를 확보하고 실제 배포로의 일반화를 보장한다.

실험 결과

연구 질문

  • RQ1보호 장치가 탑재된 이중 정책 프레임워크는 성능을 훼손시키지 않고도 Sim-to-Lab 훈련 중에 안전한 탐색을 보장할 수 있는가?
  • RQ2PAC-Bayes 일반화 경계는 예측 불가능한 실제 환경에서 안전성과 성능에 대한 확률적 보장을 어떻게 제공할 수 있는가?
  • RQ3기존의 Sim-to-Real 접근 방식에 비해 이 프레임워크는 실제 환경 배포 시 안전 위반을 얼마나 줄일 수 있는가?
  • RQ4잠재 변수 분포의 선택과 다양성은 일반화 성능 및 안전성에 대한 강건성에 어떤 영향을 미치는가?
  • RQ5Lab와 Real 환경 간의 작은 분포 이격이 발생하더라도 이 프레임워크는 인증 가능한 안전성과 성능 보장을 제공할 수 있는가?

주요 결과

  • 백업 정책에 의한 효과적인 보호 장치 덕분에, 고다양성 환경에서도 훈련 중 안전 위반을 크게 줄일 수 있었다.
  • 충분한 잠재 변수 다양성(예: β=2)이 확보된 경우, 정책 분포는 예측 불가능한 테스트 환경으로도 잘 일반화되며 안전성을 유지했다.
  • 실내 환경에서의 4족 보행 로봇에 대한 하드웨어 실험을 통해 강력한 일반화 및 안전성 성능을 입증하였으며, 이는 이론적 보장과 일치했다.
  • PAC-Bayes 경계는 최악의 환경 기대치 조건에서도 예상 성능과 안전성의 날카롭고 확률적으로 보장된 하한을 제공했다.
  • 환경 분포 이격에 대해 뛰어난 강건성을 보였으며, 환경 모델링에 대한 현실적인 가정 하에서도 이론적 보장이 유지되었다.
  • 이론적 근거와 실험적 검증을 바탕으로, 이 프레임워크는 안전이 중요한 실제 환경에서 강화학습 정책의 인증된 성능과 안전성 보장을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.