Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Policies for Reinforcement Learning via Primal-Dual Methods

Santiago Paternain, Miguel Calvo-Fullana|arXiv (Cornell University)|2019. 11. 20.
Reinforcement Learning in Robotics인용 수 12
한 줄 요약

이 논문은 전이 동역학이 알려지지 않은 MDP에서 안전성을 보장하기 위해 확률적 안전성 제약을 에르고딕 형태로 완화하는 원시-이중 강화학습 방법을 제안한다. 이는 기울기 기반 최적화를 가능하게 하며, 비볼록 문제에서 강력한 이중성을 확립하여, 미묘한 매개변수화 가정 하에 수렴성과 안전성 보장을 보장하는 확률적 근사 기반 학습을 가능하게 한다.

ABSTRACT

In this paper, we study the learning of safe policies in the setting of reinforcement learning problems. This is, we aim to control a Markov Decision Process (MDP) of which we do not know the transition probabilities, but we have access to sample trajectories through experience. We define safety as the agent remaining in a desired safe set with high probability during the operation time. We therefore consider a constrained MDP where the constraints are probabilistic. Since there is no straightforward way to optimize the policy with respect to the probabilistic constraint in a reinforcement learning framework, we propose an ergodic relaxation of the problem. The advantages of the proposed relaxation are threefold. (i) The safety guarantees are maintained in the case of episodic tasks and they are kept up to a given time horizon for continuing tasks. (ii) The constrained optimization problem despite its non-convexity has arbitrarily small duality gap if the parametrization of the policy is rich enough. (iii) The gradients of the Lagrangian associated with the safe-learning problem can be easily computed using standard policy gradient results and stochastic approximation tools. Leveraging these advantages, we establish that primal-dual algorithms are able to find policies that are safe and optimal. We test the proposed approach in a navigation task in a continuous domain. The numerical results show that our algorithm is capable of dynamically adapting the policy to the environment and the required safety levels.

연구 동기 및 목표

  • 전이 동역학이 알려지지 않은 MDP에서 안전한 강화학습 정책을 설계하기 위해, 샘플링된 궤적들만을 기반으로 한다.
  • 모델 지식이 없더라도 시간이 지남에 따라 정책가 안전 집합 내에 있을 확률이 높도록 보장한다.
  • 안전성 제약의 비볼록성과 계산이 곤란한 기울기 문제를 해결하기 위해, 확률적 제약의 에르고딕 완화를 도입한다.
  • 비볼록성에도 불구하고 제약이 있는 강화학습 문제에서 강력한 이중성을 확립하여, 체계적인 이중 최적화를 가능하게 한다.
  • 스토하스틱 근사 기반으로 동적으로 안전성과 성능 목표를 조정할 수 있는 실용적인 기울기 기반 알고리즘을 개발한다.

제안 방법

  • 경로 기반 안전성 대신 궤적에 대한 시간 평균 안전성을 갖는 에르고딕 완화를 도입한다.
  • 라그랑주 이중성에 기반해 제약이 있는 강화학습 문제를 재구성함으로써, 표준 강화학습 도구와 스토하스틱 근사 기반 기울기 계산이 가능해진다.
  • 점유도 측도와 정책 매개변수화를 사용하여 라그랑주 함수와 그 기울기를 상태-행동 방문 빈도의 형태로 표현한다.
  • 정책 공간의 기하적 성질을 활용함으로써, 비볼록 설정에서도 미묘한 조건 하에 원시 문제와 이중 문제 사이의 강력한 이중성을 확립한다.
  • 스토하스틱 기울기로 롤아웃에서 추정된 값을 사용해 정책 매개변수와 라그랑주 승수를 번갈아 갱신하는 원시-이중 알고리즘을 적용한다.
  • 매개변수화된 클래스 내에서 최적 정책의 $\epsilon$-근사값을 사용해 이중성 갭을 유한하게 제한하고 수렴성을 보장한다.

실험 결과

연구 질문

  • RQ1전이 동역학의 지식이 없이도, 안전 집합 내에 높은 확률로 존재하는 것을 보장하는 안전한 강화학습 알고리즘을 설계할 수 있는가?
  • RQ2기울기 기반 최적화를 가능하게 하면서도 안전성 보장을 유지하는 방식으로 확률적 안전성 제약을 어떻게 완화할 수 있는가?
  • RQ3비볼록 제약이 있는 강화학습 문제에서 강력한 이중성이 성립하는가? 그리고 이를 최적 정책을 찾는 데 활용할 수 있는가?
  • RQ4매개변수화된 정책 학습에서 이중성 갭과 근사 갭을 어떻게 유한하게 제한할 수 있는가? 이를 통해 안전하고 최적의 정책으로 수렴하도록 보장할 수 있는가?
  • RQ5체계적인 이중 기반 접근을 통해 연속 제어 과제에서 안전성과 성능을 어떻게 동적으로 균형 잡을 수 있는가?

주요 결과

  • 제안된 에르고딕 완화는 에피소드 및 계속적인 과제 모두에서 안전성 보장을 유지하며, 주어진 시간 범위까지 안전 집합 내 존재 확률이 높아진다.
  • 정책 매개변수화가 충분히 풍부할 경우, 비볼록성에도 불구하고 제약이 있는 강화학습 문제에서 강력한 이중성이 성립하며, 정확한 이중성 갭 제어가 가능하다.
  • 이중성 갭은 $ (B_r + \|\lambda^\star_\epsilon\|_1)\epsilon / (1 - \gamma) $로 유한하게 제한되며, 여기서 $\epsilon$는 정책 클래스의 근사 오차를 제어한다.
  • 라그랑주 함수의 스토하스틱 기울기는 표준 강화학습 기법을 사용해 계산 가능하며, 원시-이중 갱신을 통한 엔드 투 엔드 훈련이 가능하다.
  • 연속적 탐색 과제에서의 수치 실험 결과, 알고리즘이 환경 변화와 요구되는 안전 수준에 따라 동적으로 적응함을 보였다.
  • 라그랑주 승수의 도메인 특화 하이퍼파rameter 조정이 필요 없이, 이중 최적화를 통해 해결되므로 안전하고 최적의 행동을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.