Skip to main content
QUICK REVIEW

[논문 리뷰] Modeling Human Decision-making in Generalized Gaussian Multi-armed Bandits

Paul Reverdy, Vaibhav Srivastava|arXiv (Cornell University)|2013. 07. 23.
Advanced Bandit Algorithms Research참고 문헌 47인용 수 4
한 줄 요약

이 논문은 가우시안 보상이 있는 베이지안 다중 손잡이 밴딧 문제를 위한 상위 신뢰한계(UCL) 알고리즘을 제안하며, 불확실성 하에서 인간의 의사결정을 모델링한다. 이는 결정론적 및 스토케스틱 UCL 변형에 대해 상대적으로 로그 수준의 누적 기대 손실을 증명하며, 정보가 풍부한 사전 분포와 상관관계 구조를 통해 성능 향상을 보이고, 경험적 데이터를 통한 인간 행동 검증을 수행한다. 전이 비용과 그래프 구조를 가진 손잡이로의 확장을 블록 UCL 및 그래픽 블록 UCL 알고리즘을 통해 구현하였으며, 유사한 손실 경계를 확보한다.

ABSTRACT

We present a formal model of human decision-making in explore-exploit tasks using the context of multi-armed bandit problems, where the decision-maker must choose among multiple options with uncertain rewards. We address the standard multi-armed bandit problem, the multi-armed bandit problem with transition costs, and the multi-armed bandit problem on graphs. We focus on the case of Gaussian rewards in a setting where the decision-maker uses Bayesian inference to estimate the reward values. We model the decision-maker's prior knowledge with the Bayesian prior on the mean reward. We develop the upper credible limit (UCL) algorithm for the standard multi-armed bandit problem and show that this deterministic algorithm achieves logarithmic cumulative expected regret, which is optimal performance for uninformative priors. We show how good priors and good assumptions on the correlation structure among arms can greatly enhance decision-making performance, even over short time horizons. We extend to the stochastic UCL algorithm and draw several connections to human decision-making behavior. We present empirical data from human experiments and show that human performance is efficiently captured by the stochastic UCL algorithm with appropriate parameters. For the multi-armed bandit problem with transition costs and the multi-armed bandit problem on graphs, we generalize the UCL algorithm to the block UCL algorithm and the graphical block UCL algorithm, respectively. We show that these algorithms also achieve logarithmic cumulative expected regret and require a sub-logarithmic expected number of transitions among arms. We further illustrate the performance of these algorithms with numerical examples. NB: Appendix G included in this version details minor modifications that correct for an oversight in the previously-published proofs. The remainder of the text reflects the published work.

연구 동기 및 목표

  • 탐색-이용 과제에서 인간의 의사결정을 베이지안 다중 손잡이 밴딧 프레임워크를 사용하여 형식화하기 위해.
  • 가우시안 보상이 있는 표준, 전이비용, 그래프 구조를 가진 밴딧에 대해 상위 신뢰한계(UCL) 알고리즘을 개발하고 분석하기 위해.
  • 좋은 사전 분포와 상관관계 가정이 짧은 시간 간격 동안조차 성능을 크게 향상시킬 수 있음을 보여주기 위해.
  • 제어된 실험에서 수집된 인간 행동 데이터와 비교하여 스토케스틱 UCL 알고리즘의 타당성을 검증하기 위해.
  • 하나의 손잡이에서 다른 손잡이로 전이하는 데 소요되는 비용이 있는 또는 그래프 제약 조건이 있는 구조화된 의사결정 문제에 대해 UCL 프레임워크를 확장하여 블록 UCL 및 그래픽 블록 UCL 알고리즘을 제안하기 위해.

제안 방법

  • 기대 보상의 평균에 대한 사전 지식을 모델링하기 위해 베이지안 추론을 사용하며, 정보가 없는 또는 정보가 풍부한 사전 분포를 사용한다.
  • 후행 분포의 평균에 대한 상위 신뢰한계가 가장 큰 손잡이를 선택하는 결정론적 UCL 알고리즘을 제안한다.
  • 인간의 탐색 행동을 더 잘 반영하기 위해 랜덤화된 변형으로 스토케스틱 UCL 알고리즘을 도입한다.
  • UCL 프레임워크를 전이 비용이 있는 다중 손잡이 밴딧에 대한 블록 UCL과 그래프 구조를 가진 손잡이에 대한 그래픽 블록 UCL로 확장한다.
  • 선택 의존성 문제를 다루기 위해 가르비에르와 무린스가 제시한 尾 꼬리 바운드를 수정하여 이전 증명에서 간과된 점을 보완하는 정교한 증명 기법을 적용한다.
  • 프린스턴 대학교 IRB 승인을 받은 실험에서 수집한 인간 피실험자 데이터와 비교하여 모델 성능을 경험적으로 검증한다.

실험 결과

연구 질문

  • RQ1탐색-이용 과제에서 인간의 의사결정은 베이지안 다중 손잡이 밴딧 프레임워크를 통해 어떻게 형식화할 수 있는가?
  • RQ2정보가 없는 사전 분포와 정보가 풍부한 사전 분포 하에서 UCL 알고리즘의 누적 기대 손실에 대한 이론적 성능은 어떠한가?
  • RQ3사전 지식과 손잡이 간의 상관관계 가정이 의사결정 성능 향상에 얼마나 기여하는가?
  • RQ4스토케스틱 UCL 알고리즘은 밴딧 과제에서 인간의 행동 패턴을 효과적으로 반영할 수 있는가?
  • RQ5블록 UCL 및 그래픽 블록 UCL 알고리즘은 전이 비용이나 그래프 제약 조건이 존재하는 구조화된 환경에서 어떻게 성능을 발휘하는가?

주요 결과

  • 결정론적 UCL 알고리즘은 정보가 없는 사전 분포 하에서 로그 수준의 누적 기대 손실을 달성하며, 이는 최적이다.
  • 적절한 파rameter로 校정된 스토케스틱 UCL 알고리즘은 인간의 의사결정 행동을 효과적으로 반영한다.
  • 좋은 사전 분포와 상관관계 가정은 짧은 시간 간격 동안조차 손실을 크게 감소시키며, 기존 알고리즘을 초월한 성능 향상을 이룬다.
  • 블록 UCL 및 그래픽 블록 UCL 알고리즘은 로그 수준의 누적 기대 손실을 달성하며, 손잡이 간 전이의 기대 횟수는 로그 수준 이하가 된다.
  • 가르비에르와 무린스의 꼬리 바운드를 사용한 수정된 증명을 통해 원래의 손실 경계가 검증되었으며, 수정된 경계는 결정론적 UCL에 대해 $\mathbb{E}[n_i^T] \leq \frac{8a\sigma_s^2}{\Delta_i^2}\log T + o(\log T)$ 를 보여준다.
  • 인간 실험에서 수집한 경험적 데이터는 캘리브레이션된 파rameter를 가진 스토케스틱 UCL 모델이 관측된 인간 행동과 매우 유사하다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.