Skip to main content
QUICK REVIEW

[논문 리뷰] Online learning in MDPs with linear function approximation and bandit feedback

Gergely Neu, Julia Olkhovskaya|arXiv (Cornell University)|2020. 07. 03.
Advanced Bandit Algorithms Research참고 문헌 43인용 수 9
한 줄 요약

이 논문은 선형 함수 근사와 밴딧 피드백을 갖는 에피소드형 마르코프 결정 과정(MDP)에 대한 온라인 학습 알고리즘인 Online Q-REPS를 제안한다. 보상은 에피소드 간에 악성으로 변화한다. 이 알고리즘은 상태 공간 크기에 의존하지 않는 $ widetilde{ mathcal{O}}( sqrt{dHT})$의 리그레트 한계를 달성하며, 전이 동역학에 대한 완벽한 지식과 저차원 특징 맵을 활용한다.

ABSTRACT

We consider an online learning problem where the learner interacts with a Markov decision process in a sequence of episodes, where the reward function is allowed to change between episodes in an adversarial manner and the learner only gets to observe the rewards associated with its actions. We allow the state space to be arbitrarily large, but we assume that all action-value functions can be represented as linear functions in terms of a known low-dimensional feature map, and that the learner has access to a simulator of the environment that allows generating trajectories from the true MDP dynamics. Our main contribution is developing a computationally efficient algorithm that we call MDP-LinExp3, and prove that its regret is bounded by $\widetilde{\mathcal{O}}\big(H^2 T^{2/3} (dK)^{1/3}\big)$, where $T$ is the number of episodes, $H$ is the number of steps in each episode, $K$ is the number of actions, and $d$ is the dimension of the feature map. We also show that the regret can be improved to $\widetilde{\mathcal{O}}\big(H^2 \sqrt{TdK}\big)$ under much stronger assumptions on the MDP dynamics. To our knowledge, MDP-LinExp3 is the first provably efficient algorithm for this problem setting.

연구 동기 및 목표

  • 에피소드형 MDP에서 악성으로 변화하는 보상과 밴딧 피드백이 존재하는 온라인 학습 문제를 다루기 위해.
  • 선형 함수 근사를 사용하여 상태 공간 크기와 무관한 리그레트 한계를 달성하는 계산적으로 효율적인 알고리즘을 개발하기 위해.
  • 함수 근사와 함께 온라인 강화 학습에서 최적화 오차와 보상 추정 편향에 대한 이론적 분석을 제공하기 위해.
  • 기존의 온라인 RL 프레임워크를 전이 동역학에 대한 완전한 지식과 악성 보상이 존재하는 설정으로 확장하면서도 낮은 리그레트를 유지하기 위해.
  • 완벽한 동역학 지식에 기반한 최적화 오차 분석을 통해 향후 동역학에 대한 불확실성 연구의 기반을 마련하기 위해.

제안 방법

  • 알고리즘은 각 에피소드의 시작에 $d^2$차원의 볼록 최적화 문제를 해결하여 정책 업데이트를 계산하는 Online Q-REPS를 사용한다.
  • 모든 행동가치 함수가 특징에 대해 선형인 것으로 가정하며, 치수 $d$의 특징 맵을 사용하여 가치 함수와 정책을 표현한다.
  • 밴딧 피드백으로부터 보상을 추정하기 위해 역확률 가중치와 중요도 가중치를 사용하며, 추정 계획을 철저히 설계하여 편향을 최소화한다.
  • 최적 정책과 초기 분포 간의 거리를 제어하기 위해 상대 엔트로피 $D(\mu^* \| \mu_0)$ 기반 정규화 항을 포함한다.
  • 최적화 오차는 $\| \widehat{u}_{t,h} - u_{t,h} \|_1 \leq \sqrt{2\alpha\varepsilon}$로 제한하며, 여기서 $\varepsilon$는 최적화 내성이다.
  • 보상 추정 편향은 가우시안 스무딩 기법을 사용하여 제어하며, $\|b_{t,h}\|_\infty \leq \sigma R \exp(-\gamma\beta\lambda_{\min}M)$이다.

실험 결과

연구 질문

  • RQ1악성으로 변화하는 보상과 밴딧 피드백이 존재하는 에피소드형 MDP에서 상태 공간 크기에 의존하지 않는 리그레트로 온라인 학습이 가능할 수 있는가?
  • RQ2선형 함수 근사를 사용한 온라인 RL에서 정책 업데이트의 최적화 오차는 어떻게 제한할 수 있는가?
  • RQ3선형 MDP와 밴딧 피드백 설정에서 보상 추정 편향은 리그레트에 어떤 영향을 미치는가?
  • RQ4상태-행동 분포 간의 유사도 비율이 유계임을 가정하지 않고도 리그레트 한계를 유도할 수 있는가?
  • RQ5전이 함수가 알려져 있고 보상이 악성일 때, 큰 MDP에서 하위선형 리그레트를 달성할 수 있는가?

주요 결과

  • 알고리즘은 $\mathcal{O}(\sqrt{dHTD(\mu^* \| \mu_0)})$의 리그레트 한계를 달성하며, 표준 가정 하에서 $\widetilde{\mathcal{O}}(\sqrt{dHT})$로 단순화된다.
  • 리그레트 한계는 특징 공분산 행렬의 고유값이나 MDP의 혼합 시간에 의존하지 않는다.
  • 알고리즘은 계산적으로 효율적이며, 각 에피소드에서 $d^2$차원의 볼록 프로그래밍을 $d$와 $1/\varepsilon$에 다항식 시간 내에 해결한다.
  • 최적화 오차를 철저히 고려한 분석을 통해 $\| \widehat{u}_{t,h} - u_{t,h} \|_1 \leq \sqrt{2\alpha\varepsilon}$를 보였다.
  • 가우시안 스무딩을 통해 보상 추정 편향은 $\|b_{t,h}\|_\infty \leq \sigma R \exp(-\gamma\beta\lambda_{\min}M)$로 제한된다.
  • 표본 사례($d = |\mathcal{X}||\mathcal{A}|$)에서는 O-REPS의 최소최대 최적 보장을 Zimin과 Neu(2017)의 결과로 복원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.