Skip to main content
QUICK REVIEW

[논문 리뷰] Non-Stationary Reinforcement Learning: The Blessing of (More) Optimism

Wang Chi Cheung, David Simchi‐Levi|arXiv (Cornell University)|2019. 06. 07.
Advanced Bandit Algorithms Research인용 수 4
한 줄 요약

이 논문은 시간에 따라 변화하는 보상과 전이 확률이 변동 예산으로 제한되는 마르코프 결정 과정(MDP)에서 비정상적인 강화학습을 위한 SWUCRL2-CW 및 BORL 알고리즘을 제안한다. 새로운 신뢰도 확장 기법을 도입하여 낙관주의를 증가시킴으로써, 변동 예산에 대한 사전 지식이 없이도 최적의 동적 위험 경계를 달성하며, 이론적·실제 적용에서 기존 방법을 능가한다.

ABSTRACT

We consider un-discounted reinforcement learning (RL) in Markov decision processes (MDPs) under temporal drifts, ie, both the reward and state transition distributions are allowed to evolve over time, as long as their respective total variations, quantified by suitable metrics, do not exceed certain variation budgets. This setting captures the endogeneity, exogeneity, uncertainty, and partial feedback in sequential decision-making scenarios, and finds applications in vehicle remarketing and real-time bidding. We first develop the Sliding Window Upper-Confidence bound for Reinforcement Learning with Confidence Widening (SWUCRL2-CW) algorithm, and establish its dynamic regret bound when the variation budgets are known. In addition, we propose the Bandit-over-Reinforcement Learning (BORL) algorithm to adaptively tune the SWUCRL2-CW algorithm to achieve the same dynamic regret bound, but in a parameter-free manner, ie, without knowing the variation budgets. Finally, we conduct numerical experiments to show that our proposed algorithms achieve superior empirical performance compared to existing algorithms. Notably, the interplay between endogeneity and exogeneity presents a unique challenge, absent in existing (stationary and non-stationary) stochastic online learning settings, when we apply the conventional Optimism in Face of Uncertainty principle to design algorithms with provably low dynamic regret for RL in drifting MDPs. We overcome the challenge by a novel confidence widening technique that incorporates additional optimism into our learning algorithms to ensure low dynamic regret bounds. To extend our theoretical findings, we apply our framework to inventory control problems, and demonstrate how one can alternatively leverage special structures on the state transition distributions to bypass the difficulty in exploring time-varying environments.

연구 동기 및 목표

  • 시간에 따라 변화하는 보상과 전이 분포를 갖는 비정상적 MDP에서 할인을 고려하지 않은 강화학습 문제를 다루는 것.
  • 낙관주의 기반 학습을 적용할 때 내생성(정책에 의존하는 동역학)과 외생성(시간에 따라 변화하는 외부 요인) 간의 균형을 맞추는 과제를 해결하는 것.
  • 변동 예산을 사전에 알지 못해도 최적의 동적 위험 성능을 유지하면서도 파라미터가 없는 알고리즘을 설계하는 것.
  • 변동 환경에서 탐색과 위험 경계 향상에 있어 신뢰도 확장 기법의 효과를 입증하는 것.
  • 기본 방법인 UCRL2와 UCRL2.S에 비해 제안된 알고리즘이 동적 환경에서 실증적으로 뛰어나다는 것을 보여주는 것.

제안 방법

  • 변동 예산이 알려진 경우 시간에 따라 변화하는 MDP를 다룰 수 있도록 슬라이딩 윈도우 추정과 함께 신뢰도 확장 기법을 결합한 SWUCRL2-CW 알고리즘을 도입한다.
  • 값 함수 추정에 추가적인 낙관주의를 삽입함으로써 낮은 동적 위험을 보장하기 위해 새로운 신뢰도 확장 기법을 활용한다.
  • EXP3.P를 사용해 SWUCRL2-CW 알고리즘을 적응적으로 조정하는 마스터 알고리즘으로 BORL 알고리즘을 설계함으로써, 변동 예산 지식이 없더라도 파라미터가 없는 운영이 가능하도록 한다.
  • 최근의 보상과 전이 통계를 추적하기 위해 슬라이딩 윈도우 추정기를 사용하여 장기적 드리프트에 대한 민감도를 감소시킨다.
  • 신뢰도의 불확실성에 대한 낙관주의 원칙(OFU)을 수정한 형태로 적용하며, 내생성과 외생성 간의 상호작용을 보완하기 위해 신뢰도 확장 기법을 강화한다.
  • 고정비용이 있는 단일 품목 재고 제어 문제의 구조적 특성을 활용하여 특정 경우에 대해 신뢰도 확장 기법이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1시간에 따라 변화하는 보상과 전이를 갖는 비정상적 MDP에서 낙관주의 기반 강화학습이 낮은 동적 위험을 달성할 수 있는가?
  • RQ2내생성 정책 효과와 외생적 환경 드리프트 간의 상호작용을 어떻게 관리하여 낮은 위험을 유지할 수 있는가?
  • RQ3신뢰도 확장 기법을 사용해 표준 OFU 원칙을 초월하는 낙관주의를 향상시킬 수 있는가?
  • RQ4변동 예산을 알지 못해도 튜닝된 알고리즘의 위험 성능을 달성할 수 있는 파라미터가 없는 알고리즘을 설계할 수 있는가?
  • RQ5예를 들어 재고 제어에서와 같이 상태 전이의 구조적 특성은 얼마나 많은 경우에 대해 신뢰도 확장 기법의 필요성을 줄일 수 있는가?

주요 결과

  • 변동 예산 $ B_r $ 및 $ B_p $ 가 알려진 경우, SWUCRL2-CW 알고리즘은 동적 위험 경계 $ \tilde{O}(\sqrt{B_r T} + \sqrt{B_p T}) $ 를 달성하며, 로그 인자 외에는 이론적 하한선과 정확히 일치한다.
  • BORL 알고리즘은 $ B_r $ 과 $ B_p $ 를 알지 못해도 동일한 $ \tilde{O}(\sqrt{B_r T} + \sqrt{B_p T}) $ 동적 위험 경계를 달성하며, 파라미터가 없는 알고리즘으로서의 특성을 확보한다.
  • 수치 실험 결과, 저변동 및 중간 변동 조건에서 SWUCRL2-CW와 BORL 모두 UCRL2 및 UCRL2.S에 비해 누적 보상에서 최소 20% 이상 향상되었다.
  • 전이 분포의 높은 변동($ B_p = \Theta(T^{0.5}) $) 조건에서는 개선 폭이 12%에 이르렀으며, 전이 드리프트에 대한 강건성을 입증하였다.
  • 놀랍게도, 변동 예산을 모른다는 점을 감안할 때 BORL이 일부 설정에서 SWUCRL2-CW를 능가하는 결과를 보였으며, 이는 적응형 EXP3.P 마스터 알고리즘이 유리한 환경을 효과적으로 활용했음을 시사한다.
  • 특히 전이의 외생적 드리프트가 보상보다 더 심각할 경우, 신뢰도 확장 기법이 낮은 위험을 유지하는 데 핵심적인 역할을 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.