[논문 리뷰] ReLOAD: Reinforcement Learning with Optimistic Ascent-Descent for Last-Iterate Convergence in Constrained MDPs
ReLOAD는 제약된 MDP에서 표준 기울기 기반 방법이 정책을 안정화시키지 못하는 상황에서, 낙관적인 상승-하강 최적화를 사용하는 새로운 제약된 강화학습 알고리즘을 제안한다. 이 알고리즘은 마지막 반복 수렴(last-iterate convergence)을 달성하며, 표본 공간 및 함수 근사 설정 모두에서 최적 정책으로의 수렴을 보장한다. 안정성과 제약 준수 성능 향상으로 인해 도전적인 CRL 벤치마크에서 기존 방법들을 능가한다.
In recent years, Reinforcement Learning (RL) has been applied to real-world problems with increasing success. Such applications often require to put constraints on the agent's behavior. Existing algorithms for constrained RL (CRL) rely on gradient descent-ascent, but this approach comes with a caveat. While these algorithms are guaranteed to converge on average, they do not guarantee last-iterate convergence, i.e., the current policy of the agent may never converge to the optimal solution. In practice, it is often observed that the policy alternates between satisfying the constraints and maximizing the reward, rarely accomplishing both objectives simultaneously. Here, we address this problem by introducing Reinforcement Learning with Optimistic Ascent-Descent (ReLOAD), a principled CRL method with guaranteed last-iterate convergence. We demonstrate its empirical effectiveness on a wide variety of CRL problems including discrete MDPs and continuous control. In the process we establish a benchmark of challenging CRL problems.
연구 동기 및 목표
- 기존 제약된 강화학습 알고리즘에서 기울기 하강-상승에 의존함으로써 발생하는 마지막 반복 수렴의 부재를 해결하기 위해.
- 현재 정책이 평균 수렴이 아닌 최적 해로 수렴함을 보장하는 이론적으로 탄탄한 방법을 개발하기 위해.
- 이상적인 CRL 환경(이산 및 연속 제어 작업 포함)에서의 방법에 대한 실증적 검증을 위해.
- 미래의 알고리즘 평가를 위한 어려운 CRL 문제의 벤치마크를 구축하기 위해.
- 낙관적인 미러 강하가 제약된 강화학습에 효과적으로 적용될 수 있으며, 수렴 보장이 가능한가를 입증하기 위해.
제안 방법
- ReLOAD는 제약된 MDP에서 보상 극대화와 제약 준수를 균형 있게 조절하기 위해 일반화된 낙관적인 미러 강하 프레임워크를 사용한다.
- 정책 학습의 안정성과 진동 방지를 위해 낙관적 요소를 통합한 수정된 이중 변수 갱신 규칙을 도입한다.
- 업데이트 기하학을 정의하기 위해 브레그만 산란을 사용하여 비정적이고 제약된 최적화 환경에서도 수렴을 가능하게 한다.
- ReLOAD는 IMPALA 및 DMPO와 같은 오프-폴리시 딥 강화학습 알고리즘과 통합되며, 함수 근사와의 호환성을 유지한다.
- 정책 업데이트에는 낙관적인 이중 변수를, 이중 변수 업데이트에는 수정된 단계 크기 스케줄을 사용하는 이중 시간 척도 업데이트를 적용한다.
- 알고리즘은 약한 가정 하에 마지막 반복 수렴을 이룩함을 이론적으로 증명하였으며, 기존 GAN 연구 결과를 CRL로 확장한다.

실험 결과
연구 질문
- RQ1표준 기울기 하강-상승 방법이 실패하는 제약된 MDP에서 낙관적인 상승-하강 방법이 마지막 반복 수렴을 달성할 수 있는가?
- RQ2다양한 환경에서 ReLOAD는 기존 CRL 기준선 대비 정책 안정성과 제약 준수 성능에서 어떻게 비교되는가?
- RQ3현재 알고리즘의 한계를 드러내는 가장 도전적인 CRL 벤치마크는 무엇인가?
- RQ4낙관적인 이중 변수 갱신 메커니즘이 학습 중 정책 행동의 진동을 효과적으로 줄이는가?
- RQ5ReLOAD는 표본 공간 및 딥 강화학습 설정 모두에 성공적으로 적용될 수 있는가?
주요 결과
- ReLOAD는 표준 CRL 방법이 평균 정책 행동에서만 수렴하는 것과 달리, 표본 공간 및 딥 강화학습 설정 모두에서 마지막 반복 수렴을 달성한다.
- 높이 제약이 있는 Walker 환경에서 ReLOAD-IMPALA는 549.0±2.0의 가중 보상을 기록하여 OGD-IMPALA(487.5±2.8)와 μ*-IMPALA(356.7±32.8)를 크게 앞서며 성능을 뛰어넘었다.
- 속도 제약이 있는 Reacher 환경에서 ReLOAD-IMPALA는 938.1±2.9의 가중 보상을 기록하여 μ*-IMPALA(893.6±8.5)를 포함한 모든 기준선을 능가했다.
- 토크 제약이 있는 Quadruped 환경에서 ReLOAD-DMPO는 768.4±51.7의 작업 보상을 기록하여 μ*-DMPO(200.4±33.7)와 OGD-DMPO(664.6±20.7)를 압도했다.
- Humanoid 작업에서 ReLOAD-DMPO는 제약 위반 수준을 615.0±20.6로 유지하며, 더 높은 보상에도 불구하고 μ*-DMPO(44.7±0.1)보다 제약 준수 성능에서 뛰어난 성과를 보였다.
- RWRL 스위트의 12개의 어려운 제약 설정에서 ReLOAD는 정책 행동의 최소한의 진동을 보이며 일관된 성능을 보였다.
![Figure 2: Optimistic gradients achieve LIC. (a) GDA spirals outwards, while OGDA reaches the optimum. (b) The optimistic update ${\color[rgb]{0,0,0}\definecolor[named]{pgfstrokecolor}{rgb}{0,0,0}\widetilde{}\nabla\mathcal{L}^{k}}$ bends the trajectory inwards. (c) One optimistic player is not enough](https://ar5iv.labs.arxiv.org/html/2302.01275/assets/figs/minmax_xy_flipped.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.