Skip to main content
QUICK REVIEW

[논문 리뷰] Non-stationary Reinforcement Learning without Prior Knowledge: An Optimal Black-box Approach

Chen-Yu Wei, Haipeng Luo|arXiv (Cornell University)|2021. 02. 10.
Advanced Bandit Algorithms Research참고 문헌 61인용 수 17
한 줄 요약

이 논문은 정적 환경에서 최적의 리그레트를 보장하는 강화학습 알고리즘을 비정적 환경에서 최적의 동적 리그레트를 달성하는 방식으로 변환하는 블랙박스 감소 기법인 MASTER를 제안한다. 이는 비정적 환경의 특성에 대한 사전 지식이 없이도(예: 변화의 수나 크기 등) 가능하다. 다중 암표 밴드잇, 컨텍스트 밴드잇, 선형 및 일반화된 선형 밴드잇, 에피소딕 및 무한 수명 MDPs의 다양한 환경에서 $;(∗\mathcal{O}(\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\})$의 최소최대 최적 동적 리그레트 한계를 달성한다.

ABSTRACT

We propose a black-box reduction that turns a certain reinforcement learning algorithm with optimal regret in a (near-)stationary environment into another algorithm with optimal dynamic regret in a non-stationary environment, importantly without any prior knowledge on the degree of non-stationarity. By plugging different algorithms into our black-box, we provide a list of examples showing that our approach not only recovers recent results for (contextual) multi-armed bandits achieved by very specialized algorithms, but also significantly improves the state of the art for (generalized) linear bandits, episodic MDPs, and infinite-horizon MDPs in various ways. Specifically, in most cases our algorithm achieves the optimal dynamic regret $\widetilde{\mathcal{O}}(\min\{\sqrt{LT}, Δ^{1/3}T^{2/3}\})$ where $T$ is the number of rounds and $L$ and $Δ$ are the number and amount of changes of the world respectively, while previous works only obtain suboptimal bounds and/or require the knowledge of $L$ and $Δ$.

연구 동기 및 목표

  • 비정적 강화학습에서 비정적 환경의 정도에 대한 사전 지식이 없이도 최적의 동적 리그레트를 달성하는 데 도전하는 것.
  • 다양한 강화학습 설정(밴드잇 및 MDPs 포함)에 적용 가능한 일반적이고 즉시 사용 가능한 프레임워크를 개발하는 것.
  • 이전 방법들이 최적 성능을 내기 위해 $L$ (변화 수) 또는 $\Delta$ (변화의 크기)를 알고 있어야 하는 한계를 극복하는 것.
  • 환경 변화의 가정 없이도 이론적으로 최소최대 하한선에 맞는 최적의 동적 리그레트 한계를 달성하는 것.

제안 방법

  • 정적 강화학습 알고리즘에서 최적 리그레트를 보장하는 블랙박스 감소 프레임워크인 MASTER를 제안하여 비정적 환경에서 최적의 동적 리그레트를 달성하는 것.
  • 시간에 따라 변하는 가중치 부여 방식과 적응형 신뢰 구간을 사용하여 탐색과 환경 변화에 대한 적응성을 균형 잡는 것.
  • 보상 추정기의 분산을 제어하는 정책 분포를 유지하며, 밴드잇 알고리즘의 영감을 받았지만 일반 강화학습에 적합한 감소 방식을 통해 일반화된 RL에 적용하는 것.
  • UCB1, OFUL, FALCON, LSVI-UCB, UCRL과 같은 기본 알고리즘을 MASTER에 통합하여 다양한 설정에서 최적 리그레트를 달성하는 것.
  • Freedman의 부등식과 농도 경계를 활용하여 환경 변화 상황에서 추정 오차와 리그레트 분해를 제어하는 것.
  • 관측된 이탈에 기반해 탐색을 동적으로 조정함으로써 $L$과 $\Delta$가 알려지지 않은 상황에서도 안정성을 확보하는 것.

실험 결과

연구 질문

  • RQ1일반적인 블랙박스 감소 기법이 $L$ 또는 $\Delta$에 대한 사전 지식 없이도 비정적 강화학습에서 최적의 동적 리그레트를 달성할 수 있는가?
  • RQ2이 감소 기법은 다중 암표 밴드잇, 컨텍스트 밴드잇, MDPs와 같은 다양한 강화학습 설정에 적용 가능한가?
  • RQ3이 방법은 $L$ 또는 $\Delta$를 요구하지 않고도 최소최대 최적 리그레트 한계 $\widetilde{\mathcal{O}}(\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\})$를 달성하는가?
  • RQ4이 프레임워크는 전용 알고리즘과 비교해 리그레트와 적응성 측면에서 어떻게 성능을 내는가?

주요 결과

  • MASTER는 $L$ 또는 $\Delta$에 대한 사전 지식 없이도 모든 테스트 설정에서 최소최대 최적 동적 리그레트 한계 $\widetilde{\mathcal{O}}(\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\})$를 달성한다.
  • 다중 암표 및 컨텍스트 밴드잇에서는 UCB1 또는 ILTCB를 사용한 MASTER가 Auer 등(2019)과 Chen 등(2019)의 최신 기술 수준의 한계를 사전 지식 없이 재현한다.
  • 선형 및 일반화된 선형 밴드잇에서는 OFUL 또는 GLM-UCB를 사용한 MASTER가 $\Delta$ 또는 $L$이 필요 없이도 동일한 최적 리그레트를 달성하면서 이전 작업을 향상시킨다.
  • 에피소딕 MDPs에서는 Q-UCB 또는 LSVI-UCB를 사용한 MASTER가 $\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\}$ 리그레트를 달성하며, $\Delta$ 또는 하위 최적 한계를 요구하는 이전 방법보다 향상된 성능을 보인다.
  • 무한 수명 MDPs에서는 UCRL을 사용한 MASTER가 $\min\{\sqrt{LT}, \Delta^{1/3}T^{2/3}\}$ 리그레트를 달성하며, 최적의 한계를 충족하고 $\Delta$ 또는 $L$을 요구하는 이전 방법보다 뛰어난 성능을 보인다.
  • 이 프레임워크는 보편적으로 적용 가능하다: UCB 기반 또는 최적의 정적 강화학습 알고리즘을 어떤 것으로든 통합하면 비정적 환경에서 동적 리그레트 최적 알고리즘이 도출된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.