Skip to main content
QUICK REVIEW

[논문 리뷰] Upper confidence primal-dual optimization: Stochastically constrained Markov decision processes with adversarial losses and unknown transitions

Shuang Qiu, Xiaohan Wei|arXiv (Cornell University)|2020. 03. 02.
Advanced Bandit Algorithms Research인용 수 9
한 줄 요약

이 논문은 전이 동역학이 알려져 있지 않고 손실이 적대적으로 변화하는 에피소드 기반 확률적 제약이 있는 마르코프 결정 과정(CMDP)을 위한 상한 신뢰 기반 원-대안(UC-PD) 알고리즘을 제안한다. 불확실성에 대비한 낙관주의 원칙과 라그랑주 승수의 새로운 고확률 드리프트 분석을 활용하여, 알려진 전이 모델에 의존하지 않고도 $\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$의 정규화 및 제약 위반 한계를 달성한다.

ABSTRACT

We consider online learning for episodic stochastically constrained Markov decision processes (CMDP), which plays a central role in ensuring the safety of reinforcement learning. Here the loss function can vary arbitrarily across the episodes, whereas both the loss received and the budget consumption are revealed at the end of each episode. Previous works solve this problem under the restrictive assumption that the transition model of the Markov decision processes (MDP) is known a priori and establish regret bounds that depend polynomially on the cardinalities of the state space $\mathcal{S}$ and the action space $\mathcal{A}$. In this work, we propose a new \emph{upper confidence primal-dual} algorithm, which only requires the trajectories sampled from the transition model. In particular, we prove that the proposed algorithm achieves $\widetilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$ upper bounds of both the regret and the constraint violation, where $L$ is the length of each episode. Our analysis incorporates a new high-probability drift analysis of Lagrange multiplier processes into the celebrated regret analysis of upper confidence reinforcement learning, which demonstrates the power of optimism in the face of uncertainty in constrained online learning.

연구 동기 및 목표

  • 전이 동역학이 알려져 있지 않고 손실이 에피소드 간 적대적으로 변화하는 에피소드 기반 확률적 제약이 있는 MDP에서의 온라인 학습 문제를 다루는 것.
  • 기존 CMDP 알고리즘에서 요구하는 알려진 전이 모델의 제한적인 가정을 제거하여 실용적 적용 가능성을 높이는 것.
  • 불확실성과 적대적 손실 시퀀스에 대비하여 낮은 정규화와 제약 위반의 유한한 상한을 유지하는 방법을 개발하는 것.
  • 제약이 있는 강화학습에서 불확실성에 대비한 낙관주의 원칙과 원-대안 최적화를 통합하는 것.
  • 상태공간과 행동공간 크기와 효율적으로 스케일링되는 정규화 및 제약 위반에 대한 이론적 보장을 확립하는 것.

제안 방법

  • 제안된 UC-PD 알고리즘은 알려지지 않은 동역학 상황에서 탐색과 이용의 균형을 이루기 위해 가치 함수에 대한 상한 신뢰 구간을 활용한다.
  • 제약 처리를 위해 라그랑주 승수를 유지하고, 그들의 시간에 따른 변화를 제어하기 위해 새로운 고확률 드리프트 분석을 적용한다.
  • 알려진 전이 모델에 대한 사전 지식이 전혀 필요 없이 환경에서 샘플링된 궤적에 의존한다.
  • 상한 신뢰 강화학습의 낙관주의 원칙과 원-대안 업데이트를 결합하여 동시에 정규화를 최소화하고 제약을 강제한다.
  • 에피소드 수익과 제약 위반의 경험적 평균 및 분산을 사용하여 가치 추정치의 신뢰구간을 유도한다.
  • 핵심 기술적 혁신은 라그랑주 승수의 드리프트 분석을 상한 신뢰 학습의 정규화 분석과 결합하여 안정성과 수렴성을 보장하는 것이다.

실험 결과

연구 질문

  • RQ1전이 모델에 대한 사전 지식이 없는 상태에서 CMDP에 대한 온라인 학습 알고리즘을 설계할 수 있는가?
  • RQ2적대적 손실 시퀀스와 알려지지 않은 동역학 상황에서도 하한선 이상의 정규화 및 제약 위반을 달성할 수 있는가?
  • RQ3불확실성에 대비한 낙관주의 원칙을 제약이 있는 MDP에서 원-대안 최적화와 효과적으로 통합할 수 있는가?
  • RQ4이러한 완화된 가정 하에서 정규화 및 제약 위반에 대해 어떤 이론적 한계를 증명할 수 있는가?
  • RQ5라그랑주 승수의 고확률 드리프트 분석이 안정적이고 유한한 제약 강제를 보장할 수 있는가?

주요 결과

  • UC-PD 알고리즘은 $\tilde{\mathcal{O}}(L|\mathcal{S}|\sqrt{|\mathcal{A}|T})$의 상한을 정규화 및 제약 위반에 모두 달성한다. 여기서 $L$은 에피소드 길이, $|\mathcal{S}|$는 상태공간 크기, $|\mathcal{A}|$는 행동공간 크기, $T$는 에피소드 수이다.
  • 정규화 및 제약 위반 한계는 전이 모델의 기수에 의존하지 않아, 전이 동역학이 알려져 있지 않은 경우에도 적용 가능하다.
  • 알고리즘의 이론적 보장은 라그랑주 승수 과정에 대한 새로운 고확률 드리프트 분석을 통해 확립된다.
  • 이 방법은 낙관주의 원칙과 원-대안 학습을 성공적으로 통합하여, 제약이 있는 온라인 학습에서 낙관주의의 힘을 입증한다.
  • 분석 결과, 적대적 손실 시퀀스 하에서도 제약 위반은 유한하게 유지되며 정규화를 최소화하는 것으로 나타났다.
  • 기존 연구 대비 전이 모델의 알려진 가정을 제거함으로써, 실제 안전한 강화학습 환경에 더 넓은 적용 가능성을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.