Skip to main content
QUICK REVIEW

[论文解读] Regret Lower Bound and Optimal Algorithm in Dueling Bandit Problem

Junpei Komiyama, Junya Honda|arXiv (Cornell University)|Jun 8, 2015
Advanced Bandit Algorithms Research参考文献 9被引用 20
一句话总结

本文提出RMED,一种新颖的双臂赌博机算法,通过最小化成对比较中的经验分歧,实现渐近最优遗憾。它基于Kullback-Leibler分歧建立了紧致的信息论遗憾下界,并证明RMED的遗憾与该下界一致,相较于先前方法在Condorcet假设下,无论在理论上还是实践中均表现更优。

ABSTRACT

We study the $K$-armed dueling bandit problem, a variation of the standard stochastic bandit problem where the feedback is limited to relative comparisons of a pair of arms. We introduce a tight asymptotic regret lower bound that is based on the information divergence. An algorithm that is inspired by the Deterministic Minimum Empirical Divergence algorithm (Honda and Takemura, 2010) is proposed, and its regret is analyzed. The proposed algorithm is found to be the first one with a regret upper bound that matches the lower bound. Experimental comparisons of dueling bandit algorithms show that the proposed algorithm significantly outperforms existing ones.

研究动机与目标

  • 通过信息分歧建立K-臂双臂赌博机问题的紧致渐近遗憾下界。
  • 设计一种可达到该下界的算法,确保渐近最优性。
  • 克服先前算法对时域知识的依赖或对随机传递性等限制性假设的依赖。
  • 通过实证结果表明,所提算法显著优于现有双臂赌博机方法。

提出的方法

  • 提出相对最小经验分歧(RMED)算法,基于最小化与真实偏好分布的经验分歧来选择臂。
  • 采用两阶段方法:初始阶段进行均匀比较以估计成对偏好,随后进入由分歧最小化引导的学习阶段。
  • 采用基于置信度的选择规则,优先选择与Condorcet胜者估计分歧较低的臂。
  • 引入RMED1和RMED2FH变体,后者通过引入随机初始阶段以改善对最优臂偏好强度的估计。
  • 使用集中不等式和Chernoff界分析遗憾,以限制次优臂的选择次数。
  • 通过证明选择次优臂的概率呈指数衰减,推导出理论遗憾界,从而确保渐近最优性。

实验结果

研究问题

  • RQ1在Condorcet假设下,双臂赌博机问题的最紧致渐近遗憾下界是什么?
  • RQ2能否设计一种遗憾与该理论下界匹配的算法?
  • RQ3RMED在遗憾和收敛性方面与现有双臂赌博机算法(如RUCB、BTM和SAVAGE)相比表现如何?
  • RQ4初始探索阶段在准确识别Condorcet胜者并最小化遗憾方面起什么作用?
  • RQ5初始阶段长度的选择如何影响RMED2FH变体的遗憾性能?

主要发现

  • 本文基于信息分歧,首次以分析方式推导出紧致的渐近遗憾下界,为双臂赌博机问题提供了该类下界。
  • 所提出的RMED算法实现了与该下界一致的遗憾,证明其为渐近最优。
  • 实验结果表明,RMED在多个数据集上的累积遗憾显著优于现有算法(如RUCB、BTM和SAVAGE)。
  • RMED2FH变体通过优化初始阶段长度可实现近似最优性能,而次优的阶段长度则导致早期识别不佳或遗憾过大。
  • 理论分析证实,选择次优臂的概率呈指数衰减,验证了该算法的长期效率。
  • RMED1的遗憾收敛至理论下界,而RMED2在非理想偏好结构(如循环偏好)下也能收敛至真实下界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。