[논문 리뷰] Upper Confidence Primal-Dual Reinforcement Learning for CMDP with Adversarial Loss
이 논문은 전이 모델에 대한 사전 지식이 없고, 샘플링된 궤적만 이용 가능한, 적대적인 손실을 가진 에피소드형 제약 있는 마르코프 결정 과정(CMDP)에 대해 상한 신뢰도 기반 원-이중 강화 학습 알고리즘을 제안한다. 이 알고리즘은 $\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$의 위험도 및 제약 위반 한계를 달성하며, 라그랑주 승수의 고확률 드리프트 분석을 통해 불확실성 하에서의 낙관주의 원칙을 제약 있는 온라인 학습으로 확장한다.
We consider online learning for episodic stochastically constrained Markov decision processes (CMDPs), which plays a central role in ensuring the safety of reinforcement learning. Here the loss function can vary arbitrarily across the episodes, and both the loss received and the budget consumption are revealed at the end of each episode. Previous works solve this problem under the restrictive assumption that the transition model of the Markov decision processes (MDPs) is known a priori and establish regret bounds that depend polynomially on the cardinalities of the state space $\mathcal{S}$ and the action space $\mathcal{A}$. In this work, we propose a new \emph{upper confidence primal-dual} algorithm, which only requires the trajectories sampled from the transition model. In particular, we prove that the proposed algorithm achieves $\widetilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ upper bounds of both the regret and the constraint violation, where $L$ is the length of each episode. Our analysis incorporates a new high-probability drift analysis of Lagrange multiplier processes into the celebrated regret analysis of upper confidence reinforcement learning, which demonstrates the power of "optimism in the face of uncertainty" in constrained online learning.
연구 동기 및 목표
- 전이 모델, 손실 함수, 제약 함수가 모두 알려져 있지 않으며, 에피소드 간에 적대적으로 변화하는 에피소드형 CMDP에서의 온라인 학습 문제를 해결하기 위해.
- MDP의 전이 동역학에 대한 사전 지식이 필요 없이, 하위선형 위험도 및 제약 위반을 달성하는 증명 가능하게 효율적인 알고리즘을 개발하기 위해.
- 라그랑주 승수 과정의 새로운 드리프트 분석을 통해, 비제약 강화 학습에서의 '불확실성에 대한 낙관주의 원칙'을 제약 있는 온라인 학습으로 확장하기 위해.
- 에피소드 길이 $L$, 상태 공간 크기 $|\mathcal{S}|$, 행동 공간 크기 $|\mathcal{A}|$, 그리고 시간 범위 $T$에 따라 스케일링되는 날카운 대칭 위험도 및 제약 위반 한계를 확립하기 위해.
제안 방법
- 샘플링된 궤적을 이용해 보상, 제약, 전이 추정치에 대한 상한 신뢰도 구간을 유지하는 상한 신뢰도 기반 원-이중 알고리즘을 도입한다.
- 적대적인 손실 및 제약 함수가 존재하는 상황에서 이중 변수의 진화를 제어하기 위해 라그랑주 승수 과정의 고확률 드리프트 분 析을 활용한다.
- 에피소드 간에 변화하는 제약과 손실 함수에 적응하기 위해 시간에 따라 변화하는 이중 변수 갱신 규칙을 사용한다.
- 정책을 추정된 보상과 제약의 신뢰구간 기반으로 갱신하는 원-이중 최적화 프레임워크를 적용한다.
- 에포크 기반 업데이트를 통해 이중 변수의 총 변동성에 대한 새로운 경계를 도입하며, 에포크 수 $\mathcal{O}(\sqrt{T|\mathcal{S}||\mathcal{A}|}\log T)$를 활용한다.
- UCB 스타일의 낙관주의와 이중 변수 동역학의 안정성 분석을 조합하여 위험도 및 제약 위반 한계를 유도한다.
실험 결과
연구 질문
- RQ1전이 모델이 알려져 있지 않고, 손실 함수와 제약 함수가 적대적이고 시간에 따라 변화하는 에피소드형 CMDP에 대해, 증명 가능하게 효율적인 강화 학습 알고리즘을 설계할 수 있는가?
- RQ2라그랑주 승수 과정의 고확률 드리프트 분 析를 통해 '불확실성에 대한 낙관주의 원칙'을 제약 있는 온라인 학습으로 확장할 수 있는가?
- RQ3이러한 환경에서 위험도와 제약 위반 간의 최적의 트레이드오프는 무엇이며, 샘플링된 궤적만으로도 이를 달성할 수 있는가?
- RQ4알고리즘의 성능은 에피소드 길이 $L$, 상태 공간 크기 $|\mathcal{S}|$, 행동 공간 크기 $|\mathcal{A}|$, 그리고 에피소드 수 $T$에 따라 어떻게 스케일링되는가?
주요 결과
- 제안된 알고리즘은 $\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$의 위험도 및 제약 위반 한계를 달성하며, 이는 적대적 손실과 알려지지 않은 전이를 가진 CMDP에 대해 처음으로 도출된 결과이다.
- 알고리즘의 위험도 및 제약 위반 한계는 $L$, $|\mathcal{S}|$, $|\mathcal{A}|$에 대해 다항식적으로 의존하고, $T$에 대해 하위선형적으로 의존하여 확장성 잠재력을 보여준다.
- 분석은 라그랑주 승수 과정의 새로운 고확률 드리프트 분석을 도입하며, 이는 불확실성 하에서 이중 변수의 진화를 제어하는 데 핵심적이다.
- 알고리즘은 전이 모델에 대한 사전 지식이 없이도 환경에서의 샘플링된 궤적만을 사용하여 이러한 한계를 달성한다.
- 알고리즘의 에포크 수는 $\mathcal{O}(\sqrt{T|\mathcal{S}||\mathcal{A}|}\log T)$로 제한되며, 이는 이중 변수가 리셋되는 횟수를 제한한다.
- 유도된 한계는 제약이 없는 강화 학습 분야의 최신 기준과 일치하며, 최소한의 가정 하에 적대적 손실이 존재하는 제약 있는 설정으로 확장된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.