Skip to main content
QUICK REVIEW

[논문 리뷰] A Provably-Efficient Model-Free Algorithm for Constrained Markov Decision Processes

Honghao Wei, Xin Liu|arXiv (Cornell University)|2021. 06. 03.
Reinforcement Learning in Robotics참고 문헌 33인용 수 6
한 줄 요약

이 논문은 제약 마르코프 결정 과정(CMDP)에 대해 모델 자유, 시뮬레이터 자유인 강화학습 알고리즘인 Triple-Q를 제안한다. 이 알고리즘은 증명 가능한 하위선형의 손실과 제로 제약 위반을 보장한다. 세 가지 구성요소—보상 Q값, 제약 유틸리티 Q값, 누적 위반을 위한 가상 큐—를 가상의 Q값을 통해 조합하여 탐색과 안전성을 균형 잡고, $\tilde{\mathcal{O}}\big(\frac{1}{\delta}H^4 S^{1/2} A^{1/2} K^{4/5}\big)$의 손실과 큰 $K$에 대해 정확한 제약 충족을 달성한다.

ABSTRACT

This paper presents the first model-free, simulator-free reinforcement learning algorithm for Constrained Markov Decision Processes (CMDPs) with sublinear regret and zero constraint violation. The algorithm is named Triple-Q because it includes three key components: a Q-function (also called action-value function) for the cumulative reward, a Q-function for the cumulative utility for the constraint, and a virtual-Queue that (over)-estimates the cumulative constraint violation. Under Triple-Q, at each step, an action is chosen based on the pseudo-Q-value that is a combination of the three "Q" values. The algorithm updates the reward and utility Q-values with learning rates that depend on the visit counts to the corresponding (state, action) pairs and are periodically reset. In the episodic CMDP setting, Triple-Q achieves $ ilde{\cal O}\left(\frac{1 }δH^4 S^{\frac{1}{2}}A^{\frac{1}{2}}K^{\frac{4}{5}} ight)$ regret, where $K$ is the total number of episodes, $H$ is the number of steps in each episode, $S$ is the number of states, $A$ is the number of actions, and $δ$ is Slater's constant. Furthermore, Triple-Q guarantees zero constraint violation, both on expectation and with a high probability, when $K$ is sufficiently large. Finally, the computational complexity of Triple-Q is similar to SARSA for unconstrained MDPs and is computationally efficient.

연구 동기 및 목표

  • 강력한 이론적 보장을 갖춘 모델 자유, 시뮬레이터 자유 강화학습 알고리즘이 CMDP에 적용되지 않은 문제를 해결한다.
  • 충돌 회피나 예산 제한과 같은 제약 조건을 엄격히 준수해야 하는 실세계 응용 분야에서 안전한 강화학습을 가능하게 한다.
  • 환경 시뮬레이터나 알려진 모델에 의존하지 않고도 하위선형 손실과 제로 제약 위반을 달성한다.
  • 딥 러닝과 신경망을 사용한 딥 강화학습으로 확장 가능한 계산 효율성이 높은 알고리즘을 설계한다.
  • 통합 최적화 구조를 사용하여 단일 및 다중 제약 조건을 가진 CMDP에 대해 증명 가능한 효율성 프레임워크를 제공한다.

제안 방법

  • 에피소드 기반 CMDP에 대해 모델 자유 알고리즘인 Triple-Q를 도입하며, 보상 Q함수 $Q_h(x,a)$, 제약 유틸리티 Q함수 $C_h(x,a)$, 누적 제약 위반을 과대평가하는 가상 큐 $Z$의 세 구성요소를 유지한다.
  • 각 단계에서 에이전트는 다음과 같은 가상 Q값을 최대화하여 행동을 선택한다: $\arg\max_a \big(Q_h(x,a) + \frac{Z}{\eta} C_h(x,a)\big)$, 여기서 $\eta$는 제약 페널티를 스케일링하는 상수이다.
  • 상태-행동 쌍의 방문 횟수에 따라 의존하는 학습률과 보너스를 갖는 UCB 기반 탐색을 사용하며, 각 에피소드 프레임의 시작 시 학습률을 주기적으로 재설정한다.
  • 시간에 따라 변화하는 학습률을 사용하여 방문 횟수에 따라 감쇠하는 타임스탬프 기반 차분 학습을 통해 보상 및 유틸리티 Q함수를 갱신한다.
  • 가상 큐 $Z$는 느리게 갱신되어 제약 위반을 추적하고 페널티를 주어 장기적인 제약 준수를 보장한다.
  • 딥 러닝을 통해 Deep Triple-Q로 확장하며, 공유된 하이퍼파rameter를 갖는 액터-크리틱 네트워크와 주기적인 가상 큐 갱신을 사용한다.

실험 결과

연구 질문

  • RQ1모델 자유, 시뮬레이터 자유 강화학습 알고리즘이 에피소드 기반 CMDP에서 하위선형 손실을 달성할 수 있는가?
  • RQ2시뮬레이터에 의존하지 않고도 기대값과 높은 확률에서 제로 제약 위반을 보장할 수 있는가?
  • RQ3온라인 상호작용만을 사용하여 CMDP에서 안전한 탐색-이용 균형을 유지할 수 있는가?
  • RQ4함수 근사 기법을 사용하여 연속적인 상태 및 행동 공간으로 효율적으로 확장할 수 있는가?
  • RQ5가상 큐와 이중 Q함수의 통합이 이전 방법에 비해 제약 조절 성능을 어떻게 향상시키는가?

주요 결과

  • Triple-Q는 $\tilde{\mathcal{O}}\big(\frac{1}{\delta}H^4 S^{1/2} A^{1/2} K^{4/5}\big)$의 손실을 달성하며, 이는 에피소드 수 $K$에 대해 하위선형이다. 이는 환경의 수명 $H$, 상태공간 크기 $S$, 행동공간 크기 $A$, 그리고 슬레이터 상수 $\delta$에 명시적인 의존성을 보인다.
  • 에피소드 수 $K$가 충분히 클 경우, 알고리즘은 기대값과 높은 확률에서 제로 제약 위반을 보장한다. 이는 이전 방법이 허용하는 유한한 위반과 비교해 큰 개선이다.
  • 표본 격자 환경에서 Triple-Q는 약 20,000 에피소드 내에 안전하고 높은 보상을 얻는 정책을 학습하며, 학습이 중단된 후에도 정책이 효과적으로 유지된다 (Triple-Q-stop), 이는 거의 최적의 정적 정책으로 수렴함을 시사한다.
  • 연속 제어 기반 Dynamic Gym 벤치마크에서 Deep Triple-Q는 약 0.45백만 개의 학습 스텝 내에 안전하고 높은 보상을 얻는 정책을 달성하며, WCSAC보다 10배 빠른 성능을 보였다.
  • Triple-Q의 계산 복잡도는 SARSA와 유사하여 실세계 적용에 실용적이다.
  • 다중 제약 조건에 대해 각 제약 조건마다 별도의 가상 큐와 유틸리티 Q함수를 유지하며, 모든 제약 Q값의 가중합을 통해 행동 선택을 수행함으로써 일반화가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.