[논문 리뷰] Dynamic Regret of Policy Optimization in Non-stationary Environments
이 논문은 적대적 보상과 알려지지 않은 전이 커널을 가진 비정상적인 환경에서 강화학습을 위한 모델 프리 정책 최적화 알고리즘인 POWER 및 POWER++을 제안한다. 비정상적인 환경에서 변화하는 환경의 속도에 따라 적응적으로 near-optimal 정적 정책 성능을 달성하는 동적 정책 회귀 한계를 수립하며, 정책의 탐색과 적응의 두 성분으로 정책 회귀를 분해한다. POWER++는 활성 예측을 통해 적응 성분을 향상시켜 정책의 적응 능력을 향상시킨다.
We consider reinforcement learning (RL) in episodic MDPs with adversarial full-information reward feedback and unknown fixed transition kernels. We propose two model-free policy optimization algorithms, POWER and POWER++, and establish guarantees for their dynamic regret. Compared with the classical notion of static regret, dynamic regret is a stronger notion as it explicitly accounts for the non-stationarity of environments. The dynamic regret attained by the proposed algorithms interpolates between different regimes of non-stationarity, and moreover satisfies a notion of adaptive (near-)optimality, in the sense that it matches the (near-)optimal static regret under slow-changing environments. The dynamic regret bound features two components, one arising from exploration, which deals with the uncertainty of transition kernels, and the other arising from adaptation, which deals with non-stationary environments. Specifically, we show that POWER++ improves over POWER on the second component of the dynamic regret by actively adapting to non-stationarity through prediction. To the best of our knowledge, our work is the first dynamic regret analysis of model-free RL algorithms in non-stationary environments.
연구 동기 및 목표
- 단일 고정 정책로는 충분하지 않은 비정상적인 환경에서 정적 정책 회귀의 한계를 해결하기 위해.
- 적대적 전면 정보 피드백을 받는 에피소드 기반 MDP에서 변화하는 보상 함수에 적응할 수 있는 모델 프리 정책 최적화 알고리즘을 설계하기 위해.
- 비정상성의 다양한 정도에 따라 변화하는 동적 정책 회귀 한계를 설정하여, 거의 정상적인 설정을 포함한 다양한 비정상성의 영역을 통합하기 위해.
- 환경 변화가 느릴 경우 알려진 near-optimal 정적 정책 회귀 한계에 근접하는 성능을 달성함으로써 적응형 near-최적성을 입증하기 위해.
- 적대적 보상이 존재하는 비정상적인 환경에서 모델 프리 강화학습 알고리즘에 대한 첫 번째 동적 정책 회귀 분석을 제공하기 위해.
제안 방법
- 에피소드 기반 MDP에서 적대적 보상과 알려지지 않은 전이 커널을 가진 모델 프리 정책 최적화 알고리즘인 POWER 및 POWER++를 제안한다.
- 동적 정책 회귀를 두 성분으로 분해한다: 전이 커널의 불확실성으로 인한 탐색 성분과 비정상적인 보상에 대한 적응 성분.
- 정책 최적화 과정에서 온라인 미러 디센트(OMD) 업데이트를 사용하며, 보조정리 12와 보조정리 13를 통한 정책 회귀 분해를 활용한다.
- POWER++에서 활성 예측을 도입하여 정책 회귀 한계의 적응 성분을 향상시켜 보상 변화에 대한 민감도를 감소시킨다.
- 정규화 항 β를 통해 파rameterized 정책 업데이트와 신뢰도 구간을 활용한 시간 창 기반 접근법을 사용한다.
- 성능 차이 한계와 농도 불등식을 적용하여 정책 회귀 성분을 제어하며, α는 D_T와 L H log A에 기반해 적응적으로 선택된다.
실험 결과
연구 질문
- RQ1모델 프리 정책 최적화가 다양한 비정상성 정도에 따라 적응 가능한 동적 정책 회귀 한계를 달성할 수 있는가?
- RQ2비정상적인 MDP에서의 동적 정책 회귀는 정상적인 설정에서의 정적 정책 회귀와 어떻게 비교되는가?
- RQ3정책 회귀 분석에서 탐색과 적응을 분리할 수 있는가? 이는 알고리즘 설계에 어떻게 기여하는가?
- RQ4정책 업데이트에서의 활성 예측이 변화하는 보상 함수에 대한 적응 능력을 향상시키는가?
- RQ5모델 프리 방법을 사용하여 변화가 느린 환경에서 near-최적의 정책 회귀 성능를 달성할 수 있는가?
주요 결과
- POWER 및 POWER++의 동적 정책 회귀는 O~(√(D_T L H log A)) + C τ H² P_T 이하로 유계이며, 여기서 D_T는 보상 변화의 정도를 측정하고 P_T는 정책의 변화를 측정한다.
- 거의 정상적인 환경에서는 정책 회귀 한계가 O~(T^{1/2})로 단순화되며, 이는 알려진 near-optimal 정적 정책 회귀 한계와 일치한다.
- POWER++는 변화를 사전 예측함으로써 정책 회귀의 적응 성분을 향상시켜 보상 변화에 대한 의존도를 감소시킨다.
- 정책 회귀 분해가 명확하게 전이 불확실성으로 인한 탐색 성분과 비정상적인 보상으로 인한 적응 성분을 분리한다.
- 이 분석은 적대적 보상이 존재하는 비정상적인 환경에서 모델 프리 강화학습 알고리즘에 대한 첫 번째 동적 정책 회귀 한계를 수립한다.
- 이 정책 회귀 한계는 적응형이며 거의 최적이며, 정책 회귀 식에 일반적인 상수를 포함한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.