Skip to main content
QUICK REVIEW

[논문 리뷰] Asynchronous Parallel Empirical Variance Guided Algorithms for the Thresholding Bandit Problem

Jie Zhong, Yijun Huang|arXiv (Cornell University)|2017. 04. 15.
Advanced Bandit Algorithms Research참고 문헌 29인용 수 6
한 줄 요약

이 논문은 이른바 지연된 피드백 환경(예: 임상 시험, 하이퍼파라미터 튜닝)에서 효율성을 크게 향상시키기 위해 임계값 밴딧 문제를 위한 이른바 비동기 병렬 경험적 분산 지도 알고리즘(EVT 및 AP-EVT)을 제안한다. 이는 기존의 최적 알고리즘인 ATP보다 경험적 평균과 분산을 모두 활용하여 라운드 복잡도를 감소시키며, 최적의 성능을 달성하고 관측되지 않은 보상에 기반한 의사결정을 가능하게 한다.

ABSTRACT

This paper considers the multi-armed thresholding bandit problem -- identifying all arms whose expected rewards are above a predefined threshold via as few pulls (or rounds) as possible -- proposed by Locatelli et al. [2016] recently. Although the proposed algorithm in Locatelli et al. [2016] achieves the optimal round complexity in a certain sense, there still remain unsolved issues. This paper proposes an asynchronous parallel thresholding algorithm and its parameter-free version to improve the efficiency and the applicability. On one hand, the proposed two algorithms use the empirical variance to guide the pull decision at each round, and significantly improve the round complexity of the "optimal" algorithm when all arms have bounded high order moments. The proposed algorithms can be proven to be optimal. On the other hand, most bandit algorithms assume that the reward can be observed immediately after the pull or the next decision would not be made before all rewards are observed. Our proposed asynchronous parallel algorithms allow making the choice of the next pull with unobserved rewards from earlier pulls, which avoids such an unrealistic assumption and significantly improves the identification process. Our theoretical analysis justifies the effectiveness and the efficiency of proposed asynchronous parallel algorithms.

연구 동기 및 목표

  • 기존의 밴딧 알고리즘이 다음 풀 결정을 내리기 전에 전체 보상 관측을 요구하는 데 기인한 비효율성, 특히 고지연 응용 분야에서의 문제를 해결하기 위해.
  • 경험적 분산을 풀 결정에 통합하여 최적의 ATP 알고리즘의 라운드 복잡도를 향상시키기 위해.
  • 에이전트들이 부분적인 보상 관측에 기반해 의사결정을 내릴 수 있도록 허용하는 병렬적이고 비동기적 프레임워크를 설계하여 확장성과 속도를 향상시키기 위해.
  • 총 라운드 수나 파라미터에 대한 사전 지식이 필요 없는 파라미터 없는 변형(EVT_pf 및 AP-EVT_pf)을 개발하여 이론적 보장을 유지하기 위해.
  • 실제 비동기 및 지연된 피드백 조건 하에서 제안된 알고리즘의 효과성과 효율성을 이론적으로 및 실증적으로 검증하기 위해.

제안 방법

  • 경험적 평균과 분산을 모두 활용해 암 풀을 우선순위 정렬하는 경험이 분산 지도 임계값 밴딧(EVT) 알고리즘을 제안하여 라운드 복잡도를 감소시킨다.
  • 모든 이전 보상 관측을 기다리지 않고도 다음 풀 결정을 내릴 수 있도록 허용하는 비동기 병렬 EVT(AP-EVT) 알고리즘을 도입한다.
  • KL 발산 추정치의 경계를 구하고 암 식별을 위한 신뢰구간을 유도하기 위해 측도 변화 기법과 허프딩 부등식을 활용한다.
  • 암을 정의된 임계값 이상 또는 이하로 분류하기 위해 경험적 평균과 분산에 기반한 임계값 규칙을 사용한다.
  • 모든 암과 라운드에 대해 농도 부등식과 유니온 바ounds를 활용하여 기대 손실과 식별 오차에 대한 이론적 경계를 유도한다.
  • 관측된 데이터에 기반해 탐색을 동적으로 조정함으로써 파라미터 없는 변형을 개발하여 총 라운드 수나 신뢰수준에 대한 사전 지식이 필요 없도록 한다.

실험 결과

연구 질문

  • RQ1경험적 분산을 암 선택에 통합함으로써 평균만을 사용하는 방법에 비해 임계값 밴딧 문제에서 라운드 복잡도를 감소시킬 수 있는가?
  • RQ2지연된 피드백 조건 하에서 비동기 병렬 아키텍처가 밴딧 알고리즘의 이론적 보장과 실용적 효율성에 어떤 영향을 미치는가?
  • RQ3파라미터 없는 분산 지도 알고리즘의 변형은 총 라운드 수나 신뢰수준에 대한 사전 지식 없이도 최적 성능을 유지할 수 있는가?
  • RQ4병렬 밴딧 환경에서 관측되지 않은(보류 중인) 보상의 영향은 라운드 복잡도와 오차 확률에 어떤 영향을 미치는가?
  • RQ5수렴 속도와 정확도 측면에서 분산 지도 알고리즘이 ATP 알고리즘에 비해 어느 정도 뛰어나게 성능을 발휘하는가?

주요 결과

  • EVT 알고리즘은 특히 분산이 작을 경우 ATP 알고리즘보다 라운드 복잡도가 현저히 낮으며, 유한한 고차 모멘트 조건 하에서 최적임이 증명되었다.
  • AP-EVT 알고리즘은 보류 중인 보상 수와 관측된 보상 수의 비율이 지배적이지 않은 한, 관측되지 않은 보상이 존재하는 상황에서도 근사 최적의 라운드 복잡도를 유지한다.
  • 파라미터 없는 변형인 EVT_pf 및 AP-EVT_pf는 총 라운드 수나 신뢰수준에 대한 사전 지식이 없이도 파라미터 의존적 변형과 유사한 이론적 보장을 달성한다.
  • 실증 결과에 따르면 AP-EVT와 EVT는 추가 정보 접근 덕분에 파라미터 없는 변형을 略로 약간 우월하게 성능을 발휘하지만, 양측 모두 강력한 성능 유지를 보였다.
  • 이론적 분석을 통해 기대 손실이 라운드 복잡도의 지수 함수로 아래bound됨을 확인하여 제안된 알고리즘의 최적성은 입증되었다.
  • 측도 변화 및 농도 부등식 기법이 식별 오차를 효과적으로 경계함으로써, 비동기 및 지연된 피드백 조건 하에서도 알고리즘이 강인함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.