Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning of Markov Decision Processes with Peak Constraints

Ather Gattami|arXiv (Cornell University)|2019. 01. 23.
Reinforcement Learning in Robotics참고 문헌 18인용 수 5
한 줄 요약

이 논문은 피크 제약 조건이 있는 마르코프 결정 과정(MDP)에 대해 메모리 효율적인 강화 학습 알고리즘을 제안한다. 제약 조건 문제는 라그랑주 승수 방법과 클리핑을 통해 유한하고 비제약 조건이 없는 최적화 문제로 변환된다. 이 방법은 제약 함수 값을 저장하지 않으며, 미지의 동역학과 보상 함수 조건 하에서도 최적 정책으로 수렴함을 보장한다. 결과적으로 타당성과 최적성 모두 확보된다.

ABSTRACT

In this paper, we consider reinforcement learning of Markov Decision Processes (MDP) with peak constraints, where an agent chooses a policy to optimize an objective and at the same time satisfy additional constraints. The agent has to take actions based on the observed states, reward outputs, and constraint-outputs, without any knowledge about the dynamics, reward functions, and/or the knowledge of the constraint-functions. We introduce a game theoretic approach to construct reinforcement learning algorithms where the agent maximizes an unconstrained objective that depends on the simulated action of the minimizing opponent which acts on a finite set of actions and the output data of the constraint functions (rewards). We show that the policies obtained from maximin Q-learning converge to the optimal policies. To the best of our knowledge, this is the first time learning algorithms guarantee convergence to optimal stationary policies for the MDP problem with peak constraints for both discounted and expected average rewards.

연구 동기 및 목표

  • 실시간으로 제약 조건을 충족해야 하지만 제약 함수가 알려져 있지 않은 MDP에서의 강화 학습을 해결하기 위해.
  • 모든 상태-행동 제약 값 저장을 피함으로써, O(S×A×J)에서 최소한의 저장 공간으로 메모리 비용을 감소시키는 학습 알고리즘을 개발하기 위해.
  • 할인 보상 및 평균 보상 기준 모두에서 최적이고 타당한 정적 정책으로 점점 수렴함을 보장하기 위해.
  • 제약 위반이 용납되지 않는 안전 중심 응용 분야(예: 무선 통신 및 헬스케어)에서의 실용적 구현을 가능하게 하기 위해.

제안 방법

  • 이중 변수를 사용한 라그랑주 승수 방법을 통해 원래의 제약 조건이 있는 MDP를 등가의 비제약 조건 문제로 변환한다.
  • 유한성 확보와 안정적인 Q-학습을 위해 보상 함수 R(s,a) = max(−C, minλ≥0 R(s,a,λ))를 정의한다.
  • 클리핑된 보상을 사용하여 Q-학습 업데이트를 적용하여 최적 Q-값 함수 Q*(s,a)를 반복적으로 학습한다.
  • 학습된 Q-값에서 유도된 최적 정책 π*(s) = argmaxπ∈Π E[Q*(s,π(s))]를 사용한다.
  • 클리핑된 보상 공식이 원래 문제의 최적성과 타당성을 유지함을 증명함으로써 수렴성을 확보한다.
  • 이론적 결과를 활용하여, 타당한 경우에 변환된 문제의 해가 원래 문제의 최적 정책과 일치함을 보여준다.

실험 결과

연구 질문

  • RQ1알 수 없는 피크 제약 조건이 있는 MDP에 대해 강화 학습을 적용할 수 있으며, 최적이고 타당한 정책으로 수렴함을 보장할 수 있는가?
  • RQ2제약 함수가 사전에 알려져 있지 않을 때, 제약 조건이 있는 강화 학습에서 메모리 사용을 최소화할 수 있는 방법은 무엇인가?
  • RQ3목적 함수의 어떤 변환 방식이 유한성과 원래 제약 조건 문제와의 동치성을 동시에 보장하는가?
  • RQ4제안된 방법은 할인 보상 및 평균 보상 기준 모두에서 최적성과 타당성을 유지하는가?
  • RQ5모든 제약 함수 값 (s,a)↦rj(s,a)를 저장하지 않으면서도 타당성 집합 A(s)를 학습할 수 있는가?

주요 결과

  • 제안된 알고리즘은 할인 보상 및 평균 보상 기준 모두에서 피크 제약 조건이 있는 MDP에 대해 최적 정적 정책으로 수렴함을 보장한다.
  • 모든 (s,a) 쌍에 대해 제약 함수 값 rj(s,a)를 저장할 필요 없이 메모리 효율성을 달성한다.
  • 클리핑된 라그랑주 보상 R(s,a) = max(−C, minλ≥0 R(s,a,λ))를 통한 변환은 유한성을 보장하고, 표준 Q-학습이 수렴할 수 있도록 한다.
  • 학습된 Q-값에서 유도된 최적 정책은 문제의 타당성이 확보된 경우 원래 제약 조건이 있는 문제에 대해 증명 가능하게 최적이고 타당한 정책이다.
  • 이론적 분석을 통해 변환된 문제의 해가 표준 MDP 가정 하에 원래 제약 조건이 있는 MDP의 해와 동치임을 확인한다.
  • 이 방법은 무선 전력 제어 및 검색 엔진 순위 매기기와 같이 안전 제약 조건을 엄격히 준수해야 하는 실제 문제에 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.