Skip to main content
QUICK REVIEW

[논문 리뷰] UCB Momentum Q-learning: Correcting the bias without forgetting

Pierre Ménard, Omar Darwiche Domingues|arXiv (Cornell University)|2021. 03. 01.
Advanced Bandit Algorithms Research참고 문헌 24인용 수 10
한 줄 요약

이 논문은 표본의 에피소드적 MDP에 대해 Q-학습과 모멘텀 항, 상한 신뢰도를 결합한 새로운 모델-프리 강화학습 알고리즘인 UCB 모멘텀 Q-학습(UCBMQ)을 제안한다. 이 알고리즘은 편향을 보정하면서도 최소한의 위험을 유도한다. 위험 한계는 $\widetilde{\mathcal{O}}(\sqrt{H^{3}SAT} + H^{4}SA)$이며, 큰 $T$에 대해 알려진 $\Omega(\sqrt{H^{3}SAT})$ 하한선과 일치하며, 두 번째 항에서 상태 수 $S$에 대해 선형 스케일링을 보이며, 이는 동시에 최적성과 낮은 상태 의존성을 달성한 최초의 알고리즘이다.

ABSTRACT

We propose UCBMQ, Upper Confidence Bound Momentum Q-learning, a new algorithm for reinforcement learning in tabular and possibly stage-dependent, episodic Markov decision process. UCBMQ is based on Q-learning where we add a momentum term and rely on the principle of optimism in face of uncertainty to deal with exploration. Our new technical ingredient of UCBMQ is the use of momentum to correct the bias that Q-learning suffers while, at the same time, limiting the impact it has on the second-order term of the regret. For UCBMQ, we are able to guarantee a regret of at most $O(\sqrt{H^3SAT}+ H^4 S A )$ where $H$ is the length of an episode, $S$ the number of states, $A$ the number of actions, $T$ the number of episodes and ignoring terms in poly-$\log(SAHT)$. Notably, UCBMQ is the first algorithm that simultaneously matches the lower bound of $Ω(\sqrt{H^3SAT})$ for large enough $T$ and has a second-order term (with respect to the horizon $T$) that scales only linearly with the number of states $S$.

연구 동기 및 목표

  • 부정확한 과거 추정치를 기반으로 한 부트스트랩핑으로 인해 발생하는 Q-학습의 편향을 해결하기 위해.
  • 두 번째 위험 항의 상태 수 $S$에 대한 의존도를 줄여, 큰 상태 수를 가진 MDP에서 지배적인 영향을 최소화하기 위해.
  • 기존 알려진 하한선인 $\Omega(\sqrt{H^{3}SAT})$와 일치하는 위험 한계를 확보하면서도, 두 번째 항의 $S$에 대해 선형 스케일링을 유지하기 위해.
  • 모델-프리 학습의 이점(상관관계 문제 없음)과 불확실성에 대한 낙관주의(UCB)의 탐색 효율성을 결합하기 위해.

제안 방법

  • 오래된 추정치의 영향을 줄이기 위해 모멘텀 기반 업데이트 규칙을 도입하여 Q-학습의 편향을 보정한다.
  • 탐색을 장려하기 위해 상한 신뢰도(UCB)를 사용하여 불확실성에 대한 낙관주의를 보장한다.
  • 초기 최적 가치 함수의 근사치를 활용하여 분산을 줄이기 위해 기준-이득 분해 기법을 적용한다.
  • 과거 Q-값 추정치에 대한 새로운 가중치 부여 방식을 도입하여 오래된, 잠재적으로 편향된 업데이트의 영향을 통제한다.
  • Q-값 추정치의 경험적 분산 기반 신뢰구간을 사용하여 탐색과 이용의 균형을 맞춘다.
  • 집중 불등식과 모멘텀 가중 업데이트 과정의 재귀적 분석을 통해 위험 한계를 유도한다.

실험 결과

연구 질문

  • RQ1모델-프리 Q-학습 알고리즘이 정보 이론적 하한선인 $\Omega(\sqrt{H^{3}SAT})$ 와 일치하는 위험을 달성할 수 있는가?
  • RQ2두 번째 위험 항을 $S^2$나 $S^{3/2}$가 아닌 $S$에 대해 선형으로 만들 수 있는가? 특히 큰 상태 수를 가진 MDP에서.
  • RQ3모멘텀을 사용하여 Q-학습의 편향을 보정하면서도 분산을 증가시키거나 유용한 과거 정보를 잊지 않도록 할 수 있는가?
  • RQ4비정상적인 에피소드적 MDP에서 수렴성과 낮은 위험을 확보하면서도, 불확실성에 대한 낙관주의를 유지할 수 있는가?

주요 결과

  • UCBMQ는 $\widetilde{\mathcal{O}}(\sqrt{H^{3}SAT} + H^{4}SA)$의 위험 한계를 달성하며, 큰 $T$에 대해 알려진 $\Omega(\sqrt{H^{3}SAT})$ 하한선과 일치한다.
  • 두 번째 항은 이전 알고리즘들이 $S^2$나 $S^{3/2}$로 스케일링하는 것과 달리 $S$에 대해 선형 스케일링을 보이며, 이는 큰 상태 공간으로의 확장성 향상에 기여한다.
  • 알고리즘은 모멘텀를 통해 Q-학습의 편향을 성공적으로 보정하면서도, UCB 기반 탐색의 이점을 유지한다.
  • 기존 모델-프리 방법인 OptQL과 UCB-Advantage보다 더 낫지 않은 위험 한계를 확보하며, 이는 $\sqrt{H}$나 $H^{33/4}$ 인자로 인한 추가 요소가 없다.
  • 분석 결과, 모멘텀 메커니즘이 두 번째 항에 미치는 영향을 제한하여, 추정치 간 상관관계로 인해 발생하는 $S^2$ 요소를 피하는 데 기여한다.
  • 이 방법은 에피소드적 MDP에서 최초로 최적의 첫 번째 항 위험과 $S$에 대해 선형 스케일링되는 두 번째 항 스케일링을 동시에 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.