Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Policies with Zero or Bounded Constraint Violation for Constrained MDPs

Tao Liu, Ruida Zhou|arXiv (Cornell University)|2021. 06. 04.
Reinforcement Learning in Robotics참고 문헌 15인용 수 16
한 줄 요약

이 논문은 제약된 마르코프 결정 과정(CMDP)를 위한 두 가지 새로운 강화학습 알고리즘을 제안하며, 임의로 높은 확률로 $Ó(\sqrt{K})$의 손실을 달성하고 제약 위반은 0 또는 유계로 유지한다. 이 방법들은 불확실성에 대한 낙관적 비관주의(OPFU)를 적용하여 탐색을 장려하고 안전성을 확보함으로써, 엄밀한 안전 정책에 대한 사전 지식이 없더라도 학습 중에 증명 가능한 안전성을 보장한다.

ABSTRACT

We address the issue of safety in reinforcement learning. We pose the problem in an episodic framework of a constrained Markov decision process. Existing results have shown that it is possible to achieve a reward regret of $ ilde{\mathcal{O}}(\sqrt{K})$ while allowing an $ ilde{\mathcal{O}}(\sqrt{K})$ constraint violation in $K$ episodes. A critical question that arises is whether it is possible to keep the constraint violation even smaller. We show that when a strictly safe policy is known, then one can confine the system to zero constraint violation with arbitrarily high probability while keeping the reward regret of order $ ilde{\mathcal{O}}(\sqrt{K})$. The algorithm which does so employs the principle of optimistic pessimism in the face of uncertainty to achieve safe exploration. When no strictly safe policy is known, though one is known to exist, then it is possible to restrict the system to bounded constraint violation with arbitrarily high probability. This is shown to be realized by a primal-dual algorithm with an optimistic primal estimate and a pessimistic dual update.

연구 동기 및 목표

  • 학습 과정에서 제약 위반을 0 또는 유계로 보장하는 알고리즘을 설계하여 강화학습의 안전성 문제를 해결하는 것.
  • 손실을 $\tilde{\mathcal{O}}(\sqrt{K})$로 달성하면서도 안전성을 유지함으로써, 이전 방법에서 흔히 발생하는 $\tilde{\mathcal{O}}(\sqrt{K})$의 제약 위반을 극복하는 것.
  • 모델 동역학, 보상, 비용이 모두 알려지지 않은 에피소드 기반 표본형 CMDP에서 안전성과 성능에 대한 이론적 보장을 제공하는 것.
  • 새로운 OPFU 프레임워크를 통해 베이지안 문제에서의 안전 탐색 원칙을 순차적 의사결정 문제로 확장하는 것.

제안 방법

  • 제안된 OptPess-LP 알고리즘은 낙관적 원천 추정과 비관적 이중 업데이트를 사용하여 엄밀한 안전 정책이 알려져 있을 경우 제약 위반을 0으로 유지한다.
  • OptPess-PrimalDual 알고리즘은 낙관적 원천 추정과 비관적 이중 업데이트를 갖춘 원천-이중 구조를 사용하여 엄밀한 안전 정책이 알려져 있지 않을 경우 제약 위반을 유계로 유지한다.
  • 두 알고리즘 모두 불확실성에 대한 낙관적 비관주의(OPFU) 원칙을 적용하며, 낙관은 탐색을 장려하고 비관은 위험한 행동을 막는다.
  • 값 함수와 제약 조건에 대한 고확률 신뢰구간을 Hoeffding의 부등식과 집중 불등식을 통해 유도한다.
  • 리아푸노프 드리프트 분석을 통해 안정성과 수렴성을 증명하여, 높은 확률로 제약 위반이 유계로 유지됨을 보장한다.
  • 만약 $c^0$이 알려져 있지 않다면, 알고리즘은 정책 롤아웃을 통해 이를 추정하고 안전성을 유지하기 위해 비관적 상한을 사용한다.

실험 결과

연구 질문

  • RQ1에피소드 기반 CMDP에서 $\tilde{\mathcal{O}}(\sqrt{K})$의 손실을 달성하면서 제약 위반이 0이 되는가?
  • RQ2엄밀한 안전 정책이 알려져 있지 않을 경우에도 제약 위반이 높은 확률로 유계로 유지될 수 있는가?
  • RQ3불확실성에 대한 낙관적 비관주의(OPFU) 원칙을 제약 조건이 있는 순차적 의사결정 문제에 효과적으로 적용할 수 있는가?
  • RQ4OPFU 기반 알고리즘의 성능은 OFU 기반 기존 방법과 비교해 손실과 안전성 측면에서 어떻게 다른가?

주요 결과

  • 엄밀한 안전 정책이 알려져 있을 경우, OptPess-LP 알고리즘은 임의로 높은 확률로 $\tilde{\mathcal{O}}(\sqrt{K})$의 손실과 0의 제약 위반을 달성한다.
  • 엄밀한 안전 정책이 알려져 있지 않지만 존재할 경우, OptPess-PrimalDual 알고리즘은 $\tilde{\mathcal{O}}(\sqrt{K})$의 손실과 $K$에 무관한 유계 제약 위반을 달성한다.
  • 유계 경우의 제약 위반은 $\mathcal{O}(C''H + H^2\sqrt{|Σ|^3|α|C''\log(C''/\delta')})$로 표현되며, 에피소드 수 $K$에 무관하다.
  • 손실 상한은 $\tilde{\mathcal{O}}(H^3/(τ - c^0)\sqrt{|Σ|^3|α|K})$로 표현되며, 여기서 $c^0$은 알려진 안전 정책의 비용이고 $\tau$는 제약 조건 기준이다.
  • 알고리즘은 낙관(탐색을 위한)과 비관(제약 회피를 위한)의 균형을 통해 안전성을 유지하여, 높은 확률로 위험한 행동을 취하지 않는다.
  • 만약 $c^0$이 알려져 있지 않다면, 알고리즘은 $K'' = \mathcal{O}(\log K / H(\tau - c^0)^2)$개의 롤아웃을 통해 이를 추정하고, $1/(τ - c^{0'}) \leq 2/(τ - c^0)$ 조건을 만족하면서 동일한 손실 순서를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.