[논문 리뷰] Conservative Safety Critics for Exploration
CSC는 RL 탐색 중 재앙적 실패를 제한하는 보수적 안전 비판가를 학습하여 증명 가능한 실패 한계를 가진 안전한 데이터 수집을 가능하게 하면서 경쟁력 있는 작업 성능을 유지합니다.
Safe exploration presents a major challenge in reinforcement learning (RL): when active data collection requires deploying partially trained policies, we must ensure that these policies avoid catastrophically unsafe regions, while still enabling trial and error learning. In this paper, we target the problem of safe exploration in RL by learning a conservative safety estimate of environment states through a critic, and provably upper bound the likelihood of catastrophic failures at every training iteration. We theoretically characterize the tradeoff between safety and policy improvement, show that the safety constraints are likely to be satisfied with high probability during training, derive provable convergence guarantees for our approach, which is no worse asymptotically than standard RL, and demonstrate the efficacy of the proposed approach on a suite of challenging navigation, manipulation, and locomotion tasks. Empirically, we show that the proposed approach can achieve competitive task performance while incurring significantly lower catastrophic failure rates during training than prior methods. Videos are at this url https://sites.google.com/view/conservative-safety-critics/home
연구 동기 및 목표
- 데이터 수집 중 재앙적 실패를 최소화하여 RL에서 안전한 탐색을 촉진합니다.
- 탐색을 안내하기 위해 실패 확률을 과대추정하는 보수적 안전 비판기를 개발합니다.
- 각 학습 반복에서 실패 확률을 상한하는 이론적 보장을 제공합니다.
- 안전 제약이 수렴 및 작업 성능에 미치는 영향이 제한적임을 보여줍니다.
- 조작, 항해, 보행 등 다양한 작업에서 실험적 효과를 입증합니다.
제안 방법
- CQL 기반 목표를 사용하여 Q_C(s,a)가 실패 확률의 상한을 보장하는 보수적 안전 비판기를 학습합니다.
- 연속적 정책 업데이트에 KL-발산 제약을 부여하여 상태 분포의 변화를 제한합니다.
- 기대 실패 V_C^pi(mu) ≤ chi에 대한 확률 제약을 형식화하고 라그랑주 승수를 갖는 프라이멀-듀얼 그래디언트 방법으로 해결합니다.
- 환경 상호작용 중에 Q_C(s,a) ≤ ε인 행동을 선택하도록 재샘플링(rejection-sampling)과 유사한 메커니즘을 사용하며 ε는 반복마다 조정됩니다.
- 정책 업데이트에서 A_C를 과대추정된 안전성으로 대체하고, Fisher 정보 기반 KL 근사를 이용해 제약된 최적화를 해결합니다.
- 업데이트 후 V_C^pi(mu)를 상한하고 가변 chi 하에서 누적 안전 위반의 성장률이 하위선형임을 보입니다.
실험 결과
연구 질문
- RQ1보수적 안전 비판기가 온라인 RL 학습 중 재앙적 실패의 확률을 상한할 수 있습니까?
- RQ2보수적으로 학습된 비판기를 통해 안전 제약을 강제하는 것이 정책 학습과 수렴에 어떤 영향을 미칩니까?
- RQ3CSC 하에서 안전 및 성능에 대한 이론적 보장(상한/수렴)은 무엇입니까?
- RQ4이전 안전한 탐색 방법들에 비해 CSC로 학습된 정책이 불안전한 실패를 줄이면서도 경쟁력 있는 작업 성능을 달성합니까?
주요 결과
- CSC는 이전의 안전한 탐색 방법에 비해 학습 중 평균 재앙적 실패를 최대 50%까지 감소시킵니다.
- 안전 제약에도 불구하고 작업 보상 수렴이 경쟁력을 유지합니다.
- 이론적 결과는 각 정책 업데이트 후 기대 실패 확률에 대해 높은 확률의 경계를 제시합니다.
- 가변 chi 안전 임계값은 누적 안전 위반 Reg_C(T)의 하위선형 성장을 초래합니다.
- 다섯 개의 시뮬레이션 로봇 도메인(navigation, manipulation, locomotion)에서의 실험적 평가가 CSC를 통해 더 안전한 탐색을 보여줍니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.