Skip to main content
QUICK REVIEW

[논문 리뷰] A Dual Approach to Constrained Markov Decision Processes with Entropy Regularization

Donghao Ying, Yuhao Ding|arXiv (Cornell University)|2021. 10. 17.
Reinforcement Learning in Robotics참고 문헌 28인용 수 4
한 줄 요약

이 논문은 소프트맥스 파rameterization 하에서 엔트로피 정규화된 제약 있는 마르코프 결정 과정(CMDP)에 대해 이중 접근법을 제안하며, 부드러운 라그랑주 이중성(duality)을 활용해 수렴 속도를 가속화한다. 이중 변수를 위한 투영된 가속화된 경사하강법과 내부 루프에서의 자연 정책 경사하강법을 도입하여, 최적성 갭과 제약 위반 모두에 대해 $\widetilde{\mathcal{O}}(1/T)$의 전역 수렴 속도를 달성한다.

ABSTRACT

We study entropy-regularized constrained Markov decision processes (CMDPs) under the soft-max parameterization, in which an agent aims to maximize the entropy-regularized value function while satisfying constraints on the expected total utility. By leveraging the entropy regularization, our theoretical analysis shows that its Lagrangian dual function is smooth and the Lagrangian duality gap can be decomposed into the primal optimality gap and the constraint violation. Furthermore, we propose an accelerated dual-descent method for entropy-regularized CMDPs. We prove that our method achieves the global convergence rate $\widetilde{\mathcal{O}}(1/T)$ for both the optimality gap and the constraint violation for entropy-regularized CMDPs. A discussion about a linear convergence rate for CMDPs with a single constraint is also provided.

연구 동기 및 목표

  • 엔트로피 정규화가 최적화 관점에서 제약 있는 MDP에서 이론적으로 효과적인지를 확립하기 위해.
  • 슬레이터 조건과 탐색적 初기 분포 하에서 라그랑주 이중 함수의 부드러움을 분석하기 위해.
  • 증명 가능한 수렴 속도를 갖는 엔트로피 정규화된 CMDP를 위한 전역 수렴 알고리즘을 개발하기 위해.
  • 분석을 단일 제약 있는 CMDP로 확장하여, 이분법 기반 이중 방법을 사용할 경우 선형 수렴 속도를 달성할 수 있음을 보여주기 위해.

제안 방법

  • 소프트맥스 정책 파arameterization 하에서 라그랑주 이중 함수의 부드러움을 유도하기 위해 엔트로피 정규화를 활용한다.
  • 이중 변수(라그랑주 승수)를 갱신하기 위해 투영된 가속화된 경사하강법을 사용한다.
  • 각 이중 반복에 대해 원래 정책을 최적화하기 위해 내부 루프에서 자연 정책 경사하강법을 적용한다.
  • 할인된 엔트로피 정규화 항을 사용하여 이중 갭을 봉인하기 위한 샌드위치 부등식을 수립한다.
  • 강력한 이중성과 성능 차이 보조정리를 적용하여 원래 최적성 갭과 제약 위반을 이중 갭과 연결한다.
  • 정규화된 문제를 정규화 가중치 $\tau$가 작을 때 표준 CMDP를 해결하기 위한 온난 스타트(warm-start)로 고려한다.

실험 결과

연구 질문

  • RQ1소프트맥스 파arameterization 하에서 엔트로피 정규화가 CMDP의 라그랑주 이중 함수의 부드러움을 유도할 수 있는가?
  • RQ2엔트로피 정규화된 CMDP에 대해 이중 강하법이 달성할 수 있는 수렴 속도는 무엇인가?
  • RQ3엔트로피 정규화가 존재할 경우, 기존의 CMDP 방법보다 더 빠른 수렴을 달성할 수 있는가?
  • RQ4엔트로피 정규화 항을 사용하여 이중 갭을 봉인할 수 있으며, 이는 표준 CMDP의 근사에 어떤 영향을 미치는가?
  • RQ5이분법 기반 이중 방법을 사용할 경우, 단일 제약 있는 CMDP에 대해 선형 수렴 속도를 달성할 수 있는가?

주요 결과

  • 슬레이터 조건과 탐색적 初기 분포 하에서 라그랑주 이중 함수는 부드럽고, 이는 가속화된 최적화를 가능하게 한다.
  • 이중 최적성 갭에 $\mathcal{O}(\varepsilon)$ 오차가 있을 경우, 원래 최적성 갭과 제약 위반에 각각 $\mathcal{O}(\sqrt{\varepsilon})$ 오차가 발생한다.
  • 제안된 가속화된 이중 강하법은 최적성 갭과 제약 위반 모두에 대해 $\widetilde{\mathcal{O}}(1/T)$의 전역 수렴 속도를 달성한다.
  • 단일 제약 있는 CMDP의 경우, 이분법 기반 이중 방법을 통해 선형 수렴 속도를 달성할 수 있다.
  • 이중 갭은 $\tau \log|\mathcal{A}| / (1 - \gamma)$ 로 상한이 둔다. 이는 작은 $\tau$ 값이 작은 이중 갭과 표준 CMDP에 대한 우수한 근사치를 제공함을 의미한다.
  • 엔트로피 정규화된 해는 특히 $\tau = \mathcal{O}(\epsilon)$ 일 때 원래 CMDP를 해결하기 위한 온난 스타트로 기능한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.