Skip to main content
QUICK REVIEW

[논문 리뷰] Provably Safe PAC-MDP Exploration Using Analogies

Melrose Roderick, Vaishnavh Nagarajan|arXiv (Cornell University)|2020. 07. 07.
Reinforcement Learning in Robotics참고 문헌 31인용 수 4
한 줄 요약

이 논문은 확률적이고 알려지지 않은 마르코프 결정 과정(MDPs)을 위한 증명 가능하게 안전한 강화학습 알고리즘인 유사한 안정 상태 탐색(ASE)을 제안한다. 상태-행동 유사성과 안전한 초기 집합을 활용함으로써, ASE는 탐색 중 안전성을 보장하면서도 높은 확률로 PAC-MDP 최적성을 달성하며, 이는 이전 방법들에 비해 샘플 효율성을 크게 향상시킨다.

ABSTRACT

A key challenge in applying reinforcement learning to safety-critical domains is understanding how to balance exploration (needed to attain good performance on the task) with safety (needed to avoid catastrophic failure). Although a growing line of work in reinforcement learning has investigated this area of "safe exploration," most existing techniques either 1) do not guarantee safety during the actual exploration process; and/or 2) limit the problem to a priori known and/or deterministic transition dynamics with strong smoothness assumptions. Addressing this gap, we propose Analogous Safe-state Exploration (ASE), an algorithm for provably safe exploration in MDPs with unknown, stochastic dynamics. Our method exploits analogies between state-action pairs to safely learn a near-optimal policy in a PAC-MDP sense. Additionally, ASE also guides exploration towards the most task-relevant states, which empirically results in significant improvements in terms of sample efficiency, when compared to existing methods.

연구 동기 및 목표

  • 학습 중 치명적인 실패가 발생해서는 안 되는 안전이 중요한 강화학습 응용 분야에서 탐색의 안전성을 해결하기 위해.
  • 기존의 안전 강화학습 접근 방식에서의 격차를 메우기 위해, 확률적이고 알려지지 않은 환경에서 탐색 중 안전성을 보장하는 방법을 개발하기 위해.
  • 무작위적이거나 방향성이 없는 탐색 대신 임무 관련 유사한 상태-행동 쌍을 향해 탐색을 이끌어 샘플 효율성을 향상시키기 위해.
  • 높은 확률로 전체 학습 경로 동안 안전성을 유지하면서 PAC-MDP 최적성을 달성하기 위해.

제안 방법

  • ASE는 초기에 안전한 상태-행동 쌍의 집합과 유사도 측도 Δ를 사용하여, 안전성을 유지할 가능성이 높은 유사한 상태-행동 쌍을 식별한다.
  • 가장 유리한 정책은 가치 함수 추정치에 기반하여 구성되며, 이 정책을 따를 수 있는지 여부는 알려진 안전 전이에 대한 유사성에 의해 보장된다.
  • ASE는 가치 추정치에 대한 신뢰구간을 유지하고, 임계값 τ/2를 사용하여, 유사성 기반으로 상태-행동 쌍을 안전하다고 표시할 수 있는지 여부를 결정한다.
  • ASE는 가장 유리한 경로의 안전성을 높이기 위해 탐색하는 상태-행동 쌍을 통해 안전 집합을 동적으로 확장하며, 목표 지향 정책과 유사한 쌍을 우선순위로 삼는다.
  • ASE는 안전 집합에서 목표 향한 간선을 중심으로 탐색을 유도하는 유도된 탐색 전략을 사용하며, 이는 유사한 상태 간 전이를 매핑하는 유사도 함수 α에 의해 이끌린다.
  • ASE는 기존의 탐색 알고리즘(MBIE, R-Max, ε-greedy 등)을 안전한 변형으로 개선하기 위해, 행동을 추정된 안전 집합 Ẑ_safe로 제한한다.

실험 결과

연구 질문

  • RQ1모델이 알려지지 않은 동역학을 가진 확률적 MDPs에서, 결정론적이거나 매끄러운 가정에 의존하지 않고도 탐색 중 안전성을 보장할 수 있는가?
  • RQ2임무 관련 유사한 상태-행동 쌍을 향한 탐색을 집중시킴으로써, 안전 강화학습의 샘플 효율성을 어떻게 향상시킬 수 있는가?
  • RQ3높은 확률로 모든 학습 경로가 안전하도록 보장하면서도 PAC-MDP 최적성을 달성하는 것은 가능한가?
  • RQ4유사성 기반 탐색은 방향성이 없는 또는 비지향적 탐색에 비해 안전성과 샘플 효율성 측면에서 어떻게 비교되는가?

주요 결과

  • ASE는 높은 확률로 전체 학습 경로의 안전성과 PAC-MDP 최적성을 동시에 보장하며, 이는 확률적 환경에서의 새로운 기여이다.
  • 실험 결과, ASE는 기존의 안전 및 비안전 기반 방법들에 비해 특히 이산 플랫포머 게임과 같은 복잡한 MDPs에서 뚜렷이 높은 샘플 효율성을 달성한다.
  • ASE의 유사성 기반 안전 검증을 적용한 R-Max의 안전 변형은 표준 R-Max와 ε-greedy보다 안전성과 샘플 효율성 측면에서 모두 뛰어나다.
  • 모든 방향으로 탐색하는 비지향적 ASE는 지향적 ASE보다 성능이 열 劣하므로, 유사성 기반의 목표 지향적 탐색의 이점이 입증된다.
  • ASE는 가우시안 프로세스 기반의 불확실성 모델링을 피하며, 대신 유사성과 신뢰구간에 기반하여 작동함으로써, 환경의 본질적 확률적 특성을 효과적으로 처리할 수 있다.
  • 희소 보상과 고위험 전이가 존재하는 환경에서도 ASE는 기존의 안전 강화학습 기반 방법들보다 안전성과 학습 속도 측면에서 모두 뛰어나다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.