Skip to main content
QUICK REVIEW

[论文解读] A Relative Exponential Weighing Algorithm for Adversarial Utility-based Dueling Bandits

Pratik Gajane, Tanguy Urvoy|arXiv (Cornell University)|Jan 15, 2016
Advanced Bandit Algorithms Research被引用 10
一句话总结

本文提出 rex3,一种用于对抗性效用型双人赌博机的新型指数加权算法,扩展了 exp3 框架以处理相对反馈。其在有限时间内的期望遗憾边界为 $\mathcal{O}(\sqrt{K\ln K \, T})$,与经典 exp3 边界一致,并提供了匹配的 $\Omega(\sqrt{KT})$ 下界,验证了其在对抗性设置下的最优性。在信息检索数据上的实验结果证实了其优异性能,尤其在早期阶段表现突出。

ABSTRACT

We study the K-armed dueling bandit problem which is a variation of the classical Multi-Armed Bandit (MAB) problem in which the learner receives only relative feedback about the selected pairs of arms. We propose a new algorithm called Relative Exponential-weight algorithm for Exploration and Exploitation (REX3) to handle the adversarial utility-based formulation of this problem. This algorithm is a non-trivial extension of the Exponential-weight algorithm for Exploration and Exploitation (EXP3) algorithm. We prove a finite time expected regret upper bound of order O(sqrt(K ln(K)T)) for this algorithm and a general lower bound of order omega(sqrt(KT)). At the end, we provide experimental results using real data from information retrieval applications.

研究动机与目标

  • 解决在仅能获得相对反馈(例如“臂 A 比 B 好”)的对抗性效用型双人赌博机中学习的挑战。
  • 设计一种高效算法,在不假设奖励分布为随机分布的前提下,平衡探索与利用。
  • 为对抗性双人赌博机问题建立紧致的理论遗憾边界——包括上界与下界。
  • 通过实证方法在真实世界的信息检索数据集上验证算法性能,特别是在学习初期阶段的表现。

提出的方法

  • 提出 rex3,作为 exp3 算法在仅含相对反馈的双人赌博机场景下的非平凡扩展。
  • 使用瞬时遗憾估计量 $\hat{c}_i(t)$ 根据相对表现更新权重,允许负估计值。
  • 采用参数 $\gamma$ 的指数加权策略以平衡探索与利用,且在即时版本中采用自适应 $\gamma$。
  • 应用与 exp3 类似的证明结构,使用对数求和与尾部概率界限,但将其适配于相对反馈与遗憾估计。
  • 基于 Ailon 等人(2014)的工作,提出一种新颖的下界论证,确立 $\Omega(\sqrt{KT})$ 为该问题的根本极限。
  • 使用加倍技巧与自适应 $\gamma$,使 rex3 在不预先知晓时间范围 $T$ 的情况下仍能运行。

实验结果

研究问题

  • RQ1能否将指数加权算法有效适配于仅含相对反馈的对抗性双人赌博机设置?
  • RQ2在对抗性效用型双人赌博机问题中,可实现的最紧致的有限时间遗憾边界是什么?
  • RQ3rex3 在对抗性与随机性环境下的性能与当前最先进算法相比如何?
  • RQ4rex3 是否在学习初期阶段(此时探索至关重要)仍能保持优异性能?

主要发现

  • rex3 实现了有限时间期望遗憾上界 $\mathcal{O}(\sqrt{K\ln K\,T})$,与经典 exp3 边界一致。
  • 本文为对抗性效用型双人赌博机问题中任意算法建立了通用下界 $\Omega(\sqrt{KT})$,证明了上界在常数因子范围内的紧致性。
  • 采用自适应 $\gamma$ 的即时版本 rex3 在学习初期阶段优于当前最先进算法,尤其在小时间范围或高臂数场景下表现更优。
  • 在 MSLR30k 及其他信息检索数据集上的实证结果表明,rex3 表现极具竞争力,甚至在随机环境中的表现优于针对随机设置设计的算法。
  • rex3 的遗憾边界严格优于通用部分监控算法的 $\tilde{\mathcal{O}}(K\sqrt{T})$ 边界,通过消除 $K$ 的对数因子实现了改进。
  • 理论分析证实,rex3 在对抗性设置下是最优的,其上界与下界在常数因子范围内匹配。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。