Skip to main content
QUICK REVIEW

[논문 리뷰] Simple Modification of the Upper Confidence Bound Algorithm by Generalized Weighted Averages

Nobuhito Manome, Shuji Shinohara|arXiv (Cornell University)|2023. 08. 28.
Reinforcement Learning in RoboticsComputer Science인용 수 3
한 줄 요약

이 논문은 탐색과 이용의 균형을 맞추기 위해 일반화된 가중 평균을 사용하는 두 파라미터 일반화된 UCB1 알고리즘인 GWA-UCB1을 제안한다. 이 방법은 최소한의 구현 변경으로도 스토케스틱 및 서바이벌 MAB 설정에서 UCB1, 톰슨 샘플링, G-UCB1보다 성능을 향상시킨다.

ABSTRACT

The multi-armed bandit (MAB) problem is a classical problem that models sequential decision-making under uncertainty in reinforcement learning. In this study, we propose a new generalized upper confidence bound (UCB) algorithm (GWA-UCB1) by extending UCB1, which is a representative algorithm for MAB problems, using generalized weighted averages, and present an effective algorithm for various problem settings. GWA-UCB1 is a two-parameter generalization of the balance between exploration and exploitation in UCB1 and can be implemented with a simple modification of the UCB1 formula. Therefore, this algorithm can be easily applied to UCB-based reinforcement learning models. In preliminary experiments, we investigated the optimal parameters of a simple generalized UCB1 (G-UCB1), prepared for comparison and GWA-UCB1, in a stochastic MAB problem with two arms. Subsequently, we confirmed the performance of the algorithms with the investigated parameters on stochastic MAB problems when arm reward probabilities were sampled from uniform or normal distributions and on survival MAB problems assuming more realistic situations. GWA-UCB1 outperformed G-UCB1, UCB1-Tuned, and Thompson sampling in most problem settings and can be useful in many situations. The code is available at https://github.com/manome/python-mab.

연구 동기 및 목표

  • 다양한 문제 설정에서 기존의 UCB 기반 알고리즘의 탐색과 이용 균형 조절의 한계를 해결하기 위해.
  • 간단함을 유지하면서 다양한 보상 분포에 적응할 수 있도록 UCB1의 일반화를 개발하기 위해.
  • 최소한의 코드 변경으로 기존 강화 학습 파ip라인에 바로 통합 가능한 실용적인 UCB1 대체 방법을 제공하기 위해.
  • 스토케스틱 및 서바이벌 MAB 시나리오, 특히 현실적인 보상 역학을 포함한 상황에서 알고리즘의 강건성을 평가하기 위해.
  • 다양한 환경에서 성능 향상을 위한 최적의 파라미터 설정을 특정하기 위해.

제안 방법

  • 제안된 GWA-UCB1 알고리즘은 일반화된 가중 평균을 도입하여 상위 신뢰도 구간을 계산함으로써 UCB1을 일반화한다.
  • 탐색과 이용의 균형을 제어하기 위한 두 개의 조정 가능한 파라미터를 도입한다.
  • 알고리즘은 표준 신뢰도 보너스를 과거 보상과 불확실성의 일반화된 가중 평균으로 대체함으로써 UCB1 공식을 수정한다.
  • 기존의 UCB 기반 강화 학습 프레임워크에 직접 통합이 가능하도록 후행 호환성을 고려하여 설계되었다.
  • 일반화된 가중치 메커니즘은 보상 분산과 분포 특성에 동적으로 적응할 수 있도록 한다.
  • 알고리즘은 균일하거나 정규 분포 보상 분포를 가진 합성 MAB 문제와 현실 세계의 제약 조건을 시뮬레이션하는 서바이벌 MAB 문제를 통해 평가된다.

실험 결과

연구 질문

  • RQ1두 암반을 가진 스토케스틱 다중 암반 밴딧 문제에서 GWA-UCB1은 UCB1, 톰슨 샘플링, G-UCB1보다 어떻게 성능을 냈는가?
  • RQ2일반화된 가중 평균 공식은 균일하거나 정규 분포를 포함한 다양한 보상 분포에서 성능 향상을 이끌 수 있는가?
  • RQ3시간에 따라 변하거나 케이싱된 보상을 포함하는 현실 세계의 제약 조건을 모델링하는 서바이벌 MAB 문제에서 GWA-UCB1의 성능은 어떠한가?
  • RQ4다양한 MAB 문제 구성에서 GWA-UCB1의 최적 파라미터 설정은 무엇인가?
  • RQ5두 파라미터 일반화가 표준 UCB1에 비해 적응성과 강건성을 얼마나 향상시키는가?

주요 결과

  • GWA-UCB1은 두 암반을 가진 대부분의 테스트된 스토케스틱 MAB 설정에서 UCB1, 톰슨 샘플링, G-UCB1를 능가하는 성능을 보였다.
  • 암반 보상 확률이 균일 또는 정규 분포에서 샘플링된 경우, 알고리즘이 뛰어난 성능을 보였다.
  • 케이싱되거나 시간에 따라 변하는 보상을 포함하는 더 현실적인 상황을 모델링하는 서바이벌 MAB 문제에서는 GWA-UCB1가 강력한 성능을 유지했다.
  • GWA-UCB1의 최적 파라미터 설정은 기초 보상 분포에 민감하게 반응하여 그 적응성의 중요성을 입증했다.
  • UCB1 공식에 대한 간단한 수정이 계산 복잡도를 증가시키지 않으면서도 상당한 성능 향상을 이끌어냈다.
  • GWA-UCB1의 코드는 공개되어 있어 재현성과 기존 강화 학습 시스템에의 통합을 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.