[논문 리뷰] Learning in Markov Decision Processes under Constraints
이 논문은 다중 평균 비용 제약 조건이 있는 마르코프 결정 과정(MDP)를 위한 모델 기반 강화 학습 알고리즘인 UCRL-CMDP를 제안한다. 이 알고리즘은 보상의 회귀와 $M$개의 비용 회귀를 포함하는 $(M+1)$차원의 기대 회귀 벡터에 대해 $\tilde{O}(T^{2/3})$의 상한을 달성하면서도, 다른 비용의 회귀를 희생하여 일부 비용의 회귀를 줄일 수 있는 조정 가능한 트레이드오프를 가능하게 하여, 평균 비용 제약 조건 하에서 이러한 보장을 갖는 첫 번째 비에피소딕 강화 학습 알고리즘이다.
We consider reinforcement learning (RL) in Markov Decision Processes in which an agent repeatedly interacts with an environment that is modeled by a controlled Markov process. At each time step $t$, it earns a reward, and also incurs a cost-vector consisting of $M$ costs. We design model-based RL algorithms that maximize the cumulative reward earned over a time horizon of $T$ time-steps, while simultaneously ensuring that the average values of the $M$ cost expenditures are bounded by agent-specified thresholds $c^{ub}_i,i=1,2,\ldots,M$. In order to measure the performance of a reinforcement learning algorithm that satisfies the average cost constraints, we define an $M+1$ dimensional regret vector that is composed of its reward regret, and $M$ cost regrets. The reward regret measures the sub-optimality in the cumulative reward, while the $i$-th component of the cost regret vector is the difference between its $i$-th cumulative cost expense and the expected cost expenditures $Tc^{ub}_i$. We prove that the expected value of the regret vector of UCRL-CMDP, is upper-bounded as $ ilde{O}\left(T^{2\slash 3} ight)$, where $T$ is the time horizon. We further show how to reduce the regret of a desired subset of the $M$ costs, at the expense of increasing the regrets of rewards and the remaining costs. To the best of our knowledge, ours is the only work that considers non-episodic RL under average cost constraints, and derive algorithms that can~\emph{tune the regret vector} according to the agent's requirements on its cost regrets.
연구 동기 및 목표
- 알 수 없는 MDP에서 누적 보상 최대화와 다중 평균 비용 제약 조건 충족을 동시에 달성하는 강화 학습 알고리즘을 개발하는 것.
- 보상 회귀와 $M$개의 제약 조건에 대한 개별 비용 회귀를 포함하는 다차원 회귀 벡터를 정의하고 분석하는 것.
- 회귀 벡터에 대한 조정 가능한 제어를 가능하게 하여, 특정 비용 제약 조건을 다른 것들보다 우선시할 수 있도록 하는 것.
- 비에피소딕이고 온라인 학습 조건 하에서 제약 조건이 있는 MDP에서의 회귀 벡터에 대한 이론적 성능 한계를 설정하는 것.
- 어떤 학습 규칙을 사용하더라도 달성할 수 없는 회귀 벡터의 집합을 특성화하는 첫 번째 비달성 가능성 결과를 제공하는 것.
제안 방법
- 전이 확률이 알려져 있지 않은 $M$개의 평균 비용 제약 조건과 보상 목표를 가진 제약 조건이 있는 MDP 프레임워크를 수식화하는 것.
- 보상 회귀와 $M$개의 비용 회귀를 포함하는 새로운 $(M+1)$차원의 회귀 벡터를 도입하며, 각 요소는 기준치에 대한 최적성 부족을 측정한다.
- 가장적 가치 함수에 대한 상한 신뢰도와 이중 변수 추정을 통한 제약 조건 처리를 위한 UCRL-CMDP라는 모델 기반 강화 학습 알고리즘을 제안한다.
- 두 가지 시간 척도의 갱신을 사용한다: 가치 함수와 정책 추정을 위한 빠른 갱신과, 최적 라그랑주 승수를 추정하는 이중 변수 $\tilde{\lambda}_t$를 위한 느린 갱신.
- 수렴을 유지하면서도 충분한 탐색을 보장하기 위해 $\epsilon_t = 1/t$의 소프트 탐색 전략을 사용한다.
- 이중 변수 추정치 $\tilde{\lambda}_t$의 음수 값을 방지하기 위해 $[\cdot]^+$ 투영 단계를 적용한다.
실험 결과
연구 질문
- RQ1알 수 없는 MDP 동역학 조건 하에서 보상과 다중 비용 제약 조건 모두에 대해 하한선 이하의 회귀를 달성할 수 있는 강화 학습 알고리즘이 존재하는가?
- RQ2전반적인 성능을 유지하면서도 특정 비용 제약 조건을 다른 것들보다 우선시할 수 있도록 회귀 벡터를 어떻게 조정할 수 있는가?
- RQ3어떤 학습 규칙을 사용하더라도 달성할 수 없는 제약 조건이 있는 MDP에서의 기초적 회귀 벡터의 한계는 무엇인가?
- RQ4다중 비용 제약 조건과 보상 최대화를 동시에 균형 잡는 비에피소딕 강화 학습 알고리즘을 설계하는 것이 가능한가?
- RQ5이러한 제약 조건이 있는 강화 학습 프레임워크에 대해 어떤 이론적 회귀 한계를 증명할 수 있는가?
주요 결과
- UCRL-CMDP의 기대 회귀 벡터는 $\tilde{O}(T^{2/3})$로 상한이 설정되어 있으며, 제약 조건이 있는 강화 학습에 있어 중요한 이론적 보장을 제공한다.
- 알고리즘은 트레이드오프를 가능하게 하며, 일부 비용 제약 조건의 회귀를 줄이기 위해 다른 비용과 보상의 회귀를 증가시키는 것이 가능하다.
- 실험 결과 UCRL-CMDP는 다양한 도착 확률과 지연 임계값 조건에서도 낮은 보상 및 비용 회귀를 달성함을 보여준다.
- 반면에 액터-크리틱 기반 알고리즘은 보상 회귀는 낮지만 비용 회귀가 극도로 높아 제약 조건 충족 측면에서 UCRL-CMDP의 우월성을 드러낸다.
- 도착 분포와 채널 신뢰도와 같은 다양한 시스템 파라미터 조건에서도 알고리즘이 안정적인 성능을 유지한다.
- 비달성 가능성 결과는 어떤 학습 규칙을 사용하더라도 달성할 수 없는 회귀 벡터의 집합을 특성화하여, 이 프레임워크의 이론적 한계를 설정한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.