Skip to main content
QUICK REVIEW

[논문 리뷰] A Sample-Efficient Algorithm for Episodic Finite-Horizon MDP with Constraints

Krishna C. Kalagarla, Rahul Jain|arXiv (Cornell University)|2020. 09. 23.
Formal Methods in Verification인용 수 12
한 줄 요약

이 논문은 전이 확률이 알려져 있지 않은 에피소딕 유한 수명 주기 제약 있는 MDPs를 위한 샘플 효율적인 온라인 알고리즘 UC-CFH를 제안한다. 점진적인 계획법을 통해 점유도 측정값에서 선형 프로그래밍을 활용함으로써, 샘플 복잡도 $\tilde{\mathcal{O}}\big{(}\frac{|\mathcal{S}||\mathcal{A}|C^{2}H^{2}}{\epsilon^{2}}\log\frac{1}{\delta}\big{)}$ 를 갖는 PAC 보장을 달성한다. 여기서 $C$ 는 각 상태-행동 쌍당 최대 후속 상태 수이며, 높은 확률로 $\epsilon$-최적 성능와 제약 조건 이행을 보장한다.

ABSTRACT

Constrained Markov Decision Processes (CMDPs) formalize sequential decision-making problems whose objective is to minimize a cost function while satisfying constraints on various cost functions. In this paper, we consider the setting of episodic fixed-horizon CMDPs. We propose an online algorithm which leverages the linear programming formulation of finite-horizon CMDP for repeated optimistic planning to provide a probably approximately correct (PAC) guarantee on the number of episodes needed to ensure an $ε$-optimal policy, i.e., with resulting objective value within $ε$ of the optimal value and satisfying the constraints within $ε$-tolerance, with probability at least $1-δ$. The number of episodes needed is shown to be of the order $ ilde{\mathcal{O}}\big(\frac{|S||A|C^{2}H^{2}}{ε^{2}}\log\frac{1}δ\big)$, where $C$ is the upper bound on the number of possible successor states for a state-action pair. Therefore, if $C \ll |S|$, the number of episodes needed have a linear dependence on the state and action space sizes $|S|$ and $|A|$, respectively, and quadratic dependence on the time horizon $H$.

연구 동기 및 목표

  • 전이 확률이 알려져 있지 않을 때, 제약 조건이 있는 에피소딕 유한 수명 주기 MDPs에서 근사 최적 정책을 학습하는 데 도전하는 것.
  • 온라인 학습 중 성능과 제약 조건 이행에 대해 유의미하게 근사적 정확도를 보장하는 Probably Approximately Correct (PAC) 보장 제공.
  • 에피소드 수를 최소화하여 $\epsilon$-최적 정책에 도달하기 위해 샘플 효율성 확보.
  • 점진적인 계획법의 원리인 '불확실성에 대한 낙관주의'를 점유도 측정값에서의 새로운 선형 프로그래밍 설정을 통해 제약 있는 MDPs로 확장.
  • 샘플 복잡도에서 시간 수명 주기 $H$ 의 의존도를 이전의 제귀 기반 설정에서 삼차에서 이차로 감소시켜 성능 향상.

제안 방법

  • 알고리즘은 탐색과 이용의 균형을 이루기 위해 '불확실성에 대한 낙관주의' 원리를 기반으로 한 낙관적 계획 접근법을 사용한다.
  • 관측된 궤적에서 통계적으로 타당한 전이 모델 세트를 구성하며, 시간이 지남에 따라 신뢰 구간을 업데이트한다.
  • 낙관적 정책 선택은 점유도 측정값에서의 선형 프로그래밍(LP)으로 설정되며, 예상 누적 비용에 대한 제약 조건을 포함한다.
  • 알고리즘은 상태-행동 쌍이 충분히 자주 방문될 때까지 다수의 에피소드 동안 낙관적 정책을 실행하고, 방문 빈도 수를 갱신한 후 반복한다.
  • 모델 불확실성을 제한하기 위해 농도 부등식을 활용하며, 정책 품질과 제약 조건 이행에 대한 높은 확률 보장을 보장한다.
  • 샘플 복잡도는 신뢰 구간의 재귀적 분석과 $m_1$ 및 $m$ 을 포함하는 새로운 매개변수화를 통해 유도되며, $|\mathcal{S}|$, $|\mathcal{A}|$, $C$, $H$, $\epsilon$, $\delta$ 에 대해 날카로운 경계를 제공한다.

실험 결과

연구 질문

  • RQ1전이 확률이 알려져 있지 않은 에피소딕 유한 수명 주기 CMDPs에서 $\epsilon$-최적 정책을 보장하기 위해 필요한 최소 에피소드 수는 얼마인가?
  • RQ2불확실성에 대한 낙관주의 원리가 제약 있는 MDPs로 효과적으로 확장될 수 있으며, 증명 가능한 PAC 보장이 가능한가?
  • RQ3샘플 복잡도는 상태 공간 크기 $|\mathcal{S}|$, 행동 공간 크기 $|\mathcal{A}|$, 수명 주기 $H$, 제약 조건 구조에 따라 어떻게 척도화되는가?
  • RQ4샘플 복잡도 경계에서 수명 주기 $H$ 에 대한 의존도를 삼차에서 이차로 줄일 수 있는가?
  • RQ5최대 후속 상태 수 $C$ 는 학습 알고리즘의 전체 샘플 효율성에 어떤 영향을 미치는가?

주요 결과

  • 제안된 UC-CFH 알고리즘은 $\epsilon$-최적 정책에 도달하기 위해 샘플 복잡도 $\tilde{\mathcal{O}}\big{(}\frac{|\mathcal{S}||\mathcal{A}|C^{2}H^{2}}{\epsilon^{2}}\log\frac{1}{\delta}\big{)}$ 를 달성하며, 확률 $1-\delta$ 이상로 보장한다.
  • 샘플 복잡도는 수명 주기 $H$ 에 대해 이차 의존성을 보이며, 이전의 제귀 기반 설정에서 유도된 삼차 경계에 비해 향상된다.
  • $C \ll |\mathcal{S}|$ 인 경우, 알고리즘은 $|\mathcal{S}|$ 와 $|\mathcal{A}|$ 에 대해 선형 의존성을 보이며, 큰 상태 공간과 행동 공간에 대해 확장 가능하다.
  • 알고리즘은 제약 조건을 높은 확률로 $\epsilon$-허용 오차 내에서 이행함을 보장하며, 제약 위반에 대한 공식적인 보장을 제공한다.
  • 분석을 통해 에이전트가 $\epsilon$-부적절한 정책을 실행하는 에피소드 수는 높은 확률로 유도된 샘플 복잡도로 제한됨을 밝혀냈다.
  • 이 방법은 생성 모델이 필요 없으며, 관측된 궤적만으로도 작동하여 실용적 적용 가능성을 높인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.