Skip to main content
QUICK REVIEW

[논문 리뷰] Recovery RL: Safe Reinforcement Learning with Learned Recovery Zones

Brijen Thananjeyan, Ashwin Balakrishna|arXiv (Cornell University)|2020. 10. 29.
Reinforcement Learning in Robotics참고 문헌 35인용 수 20
한 줄 요약

Recovery RL은 사전 학습된 복구 정책을 오프라인 데이터 기반으로 사용하여 작업 학습과 안전 보장의 분리를 구현하는 이중 정책 프레임워크를 제안한다. 이는 제약 위반을 피하기 위해 설계되었으며, 시뮬레이션에서는 이전 방법 대비 2–20배 향상된 작업 성공률과 제약 위반의 균형을 달성했고, 물리적 로봇 실험에서는 3배 향상되었다.

ABSTRACT

Safety remains a central obstacle preventing widespread use of RL in the real world: learning new tasks in uncertain environments requires extensive exploration, but safety requires limiting exploration. We propose Recovery RL, an algorithm which navigates this tradeoff by (1) leveraging offline data to learn about constraint violating zones before policy learning and (2) separating the goals of improving task performance and constraint satisfaction across two policies: a task policy that only optimizes the task reward and a recovery policy that guides the agent to safety when constraint violation is likely. We evaluate Recovery RL on 6 simulation domains, including two contact-rich manipulation tasks and an image-based navigation task, and an image-based obstacle avoidance task on a physical robot. We compare Recovery RL to 5 prior safe RL methods which jointly optimize for task performance and safety via constrained optimization or reward shaping and find that Recovery RL outperforms the next best prior method across all domains. Results suggest that Recovery RL trades off constraint violations and task successes 2 - 20 times more efficiently in simulation domains and 3 times more efficiently in physical experiments. See https://tinyurl.com/rl-recovery for videos and supplementary material.

연구 동기 및 목표

  • 로봇이나 환경 손상의 위험이 있는 실제 강화 학습 환경에서의 안전 탐색 문제를 해결한다.
  • 학습 과정에서 작업 성능을 극대화하고 불안전 행동을 최소화하는 데 갈등이 발생하는 문제를 해결한다.
  • 학습 중 온라인 제약 위반에 의존하지 않고, 오프라인 데이터를 활용해 위험한 상태와 복구 행동을 사전 학습함으로써 이를 줄인다.
  • 작업 정책 최적화와 안전 제약을 분리하여, 병행 최적화로 인한 비최적 정책을 방지한다.
  • 고차원 관측 공간(예: 이미지)을 갖는 물리적 로봇 시스템에서 효율적이고 안전한 정책 학습을 가능하게 한다.

제안 방법

  • 작업 보상만 최적화하는 작업 정책과 제약 위반이 발생할 가능성이 높을 때 활성화되는 복구 정책을 별도로 사용한다.
  • 인간의 시연나 이전의 불안전 경험에서 수집한 오프라인 데이터를 사용해 복구 정책과 위험 인식 Q함수를 사전 학습한다.
  • 오프라인 데이터와 위험 추정 기반으로 향후 제약 위반이 발생할 가능성이 높은 MDP 영역을 복구 영역으로 정의한다.
  • 행동 재라벨링을 사용해 작업 정책을 훈련시켜 행동과 실제 결과를 연관지켜 샘플 효율성과 성공률을 향상시킨다.
  • 위험 인식 Q함수를 사용해 향후 제약 위반의 확률을 추정하고, 위험 수준이 임계값을 초과할 경우 복구 정책을 활성화한다.
  • 오프라인 사전 학습 동안 확립된 안전 보장을 유지하면서도, 온라인에서 두 정책의 최적화를 허용한다.

실험 결과

연구 질문

  • RQ1오프라인 사전 학습된 복구 정책이 온라인 제약 위반에 의존하지 않고도 안전성과 샘플 효율성을 향상시킬 수 있는가?
  • RQ2작업 최적화와 안전 보장의 분리를 통해 학습된 정책의 성능과 내구성에 어떤 영향을 미치는가?
  • RQ3Recovery RL이 작업 성공률와 제약 위반의 균형을 잘 맞추는 데서 공동 최적화 방법보다 얼마나 뛰어나게 성능을 내는가?
  • RQ4복구 정책의 사전 학습에 사용된 오프라인 데이터의 양에 대해 Recovery RL의 민감도는 어느 정도인가?
  • RQ5Recovery RL은 고차원 시각적 관측과 실제 로봇 제어 작업에 일반화될 수 있는가?

주요 결과

  • Recovery RL은 여섯 개의 시뮬레이션 도메인에서 다섯 가지 최첨단 안전 강화 학습 방법보다 뛰어나며, 작업 성공률와 제약 위반의 균형에서 2–20배 향상된 성능을 달성했다.
  • 이미지 기반 장애물 회피 작업에서의 물리적 로봇 실험에서, Recovery RL은 다음으로 좋은 베이스라인 대비 제약 위반을 3배 감소시켰다.
  • 복구 정책과 위험 함수의 오프라인 사전 학습을 생략할 경우 성능이 크게 떨어지며, 이는 오프라인 데이터의 중요성을 입증한다.
  • 복구 정책 사전 학습에 1,000건의 오프라인 전이 데이터만으로도 양호한 성능을 달성하며, 이 수치 이하로 데이터가 감소하면 성능이 급격히 떨어진다.
  • 작업 정책 학습 중 행동 재라벨링이 필수적이다. 이를 생략할 경우 작업 성공률가 급격히 감소한다.
  • 특히 위험 임계값과 위험 계수의 하이퍼파rameter 조정에 민감도가 낮아 기존 방법보다 더 적은 튜닝이 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.