[논문 리뷰] Policy Mirror Descent for Regularized Reinforcement Learning: A Generalized Framework with Linear Convergence
이 논문은 Bregman 발산을 사용하여 임의의 볼록 정규화자를 다룰 수 있는 일반화된 정책 미러 강하(GPMD)를 제안한다. 이는 정규화된 강화학습을 위한 통합 프레임워크로, 부드럽지 않거나 강력한 볼록성이 없는 정규화자 조건에서도 다양한 학습률 범위에서 전역 최적해로의 선형 수렴을 보장하며, 정확도가 떨어지는 정책 평가 조건에서도 증명 가능한 안정성과 차원에 의존하지 않는 수렴 속도를 확보한다.
Policy optimization, which finds the desired policy by maximizing value functions via optimization techniques, lies at the heart of reinforcement learning (RL). In addition to value maximization, other practical considerations arise as well, including the need of encouraging exploration, and that of ensuring certain structural properties of the learned policy due to safety, resource and operational constraints. These can often be accounted for via regularized RL, which augments the target value function with a structure-promoting regularizer. Focusing on discounted infinite-horizon Markov decision processes, we propose a generalized policy mirror descent (GPMD) algorithm for solving regularized RL. As a generalization of policy mirror descent (arXiv:2102.00135), our algorithm accommodates a general class of convex regularizers and promotes the use of Bregman divergence in cognizant of the regularizer in use. We demonstrate that our algorithm converges linearly to the global solution over an entire range of learning rates, in a dimension-free fashion, even when the regularizer lacks strong convexity and smoothness. In addition, this linear convergence feature is provably stable in the face of inexact policy evaluation and imperfect policy updates. Numerical experiments are provided to corroborate the appealing performance of GPMD.
연구 동기 및 목표
- 엔트로피와 같은 특정 정규화자 외의 일반화된 정책 최적화 이론의 부재를 해결한다.
- 비연속 및 비강력 볼록 정규화자를 포함한 광범위한 볼록 정규화자 클래스를 수용할 수 있는 통합 알고리즘 프레임워크를 개발한다.
- 강력한 볼록성이나 미분 가능성 없이도 일반 정규화자 조건 하에서 정책 최적화의 선형 수렴 보장을 확립한다.
- 실제 강화학습 환경에서 흔히 발생하는 정책 평가의 부정확성과 불완전한 정책 업데이트에 대한 강건성을 확보한다.
- 넓은 학습률 범위에서 균일하게 적용 가능한 차원에 의존하지 않는 수렴 분석을 제공한다.
제안 방법
- 선택된 정규화자에 맞는 Bregman 발산을 통합한 정책 미러 강하의 일반화로 Generalized Policy Mirror Descent(GPMD)를 제안한다.
- 정규화자가 유도하는 기하학적 구조와 일치하는 방향으로 업데이트를 유도하기 위해 Bregman 발산을 발산 측도로 사용한다. 이는 민감하고 구조를 유지하는 정책 업데이트를 가능하게 한다.
- Bregman 발산을 사용해 정규화된 목적함수 최소화 문제로 정책 업데이트를 수식화함으로써, 정책이 정규화자에 의해 정의된 탇합 영역 내에 유지되도록 보장한다.
- 정책 간의 Bregman 발산과 그 기울기 간의 관계를 연결하는 성능 차이 보조정리를 통해 수렴성을 확립한다.
- 정확한 및 부정확한 GPMD 변형을 분석하여, Q-값 차이에 대한 수축 원리를 이용해 온건한 가정 하에 선형 수렴을 증명한다.
- 에포크별로 단계 크기와 반복 횟수 전략을 도입하여, 정책 평가가 근사적일 경우에도 오차가 기하급수적으로 감소하도록 보장한다.
실험 결과
연구 질문
- RQ1강화학습에서 임의의 볼록 정규화자를 지원하는 통합 정책 최적화 프레임워크를 개발할 수 있는가?
- RQ2제안된 GPMD 알고리즘이 정규화자가 강력 볼록성이나 미분 가능성이 없더라도 여전히 전역 최적해로 선형 수렴하는가?
- RQ3정책 평가가 정확하지 않거나 정책 업데이트가 불완전한 조건에서 알고리즘의 성능은 어떠하며, 여전히 수렴 보장이 가능한가?
- RQ4수렴 속도는 차원에 의존하지 않으며, 넓은 학습률 범위에서 균일하게 유지되는가?
- RQ5Bregman 발산의 선택이 일반 정규화자 조건 하에서 정책 최적화의 안정성과 수렴성에 미치는 영향은 어떠한가?
주요 결과
- GPMD는 정규화자가 강력 볼록성이나 미분 가능성이 없더라도, 다양한 학습률 범위에서 전역 최적 정책으로 선형 수렴을 달성한다.
- 수렴 속도는 차원에 의존하지 않으며, 상태공간 또는 행동공간의 크기 증가에 따라 악화되지 않는다.
- 정책 평가의 정확도가 떨어지거나 정책 업데이트가 불완전한 조건에서도 증명 가능한 안정성을 확보하며, 반복 횟수에 따라 오차가 기하급수적으로 감소한다.
- 각 에포크에서 내부 반복 횟수 $ T_i $ 는 $ \big\lfloor \frac{1+\tau_i\theta}{\theta(1-\rho)} \rho \big\rfloor $ 로 선택할 수 있으며, 이는 오차의 기하급수적 감소를 보장한다. 여기서 $ \theta $ 는 정규화자 매개변수이고, $ \rho $ 는 할인 요소이다.
- 현재 정책과 최적 정책 간의 성능 간격은 $ \frac{\tau_i B}{1-\rho} $ 로 감소하며, $ \tau_i $ 는 단계 크기이고 $ B $ 는 Q-값 차이의 상한이다.
- 수치 실험을 통해 GPMD가 엔트로피 및 제약 정규화 조건 하에서 표준 정책 기울기 및 자연 정책 기울기 방법보다 수렴 속도와 안정성 면에서 뛰어나다는 것이 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.