[论文解读] Combinatorial Bandits with Relative Feedback
本文提出了一种基于UCB的实例最优算法,用于在多项式对数(MNL)选择模型下,具有相对反馈的组合Bandits问题。通过引入最大最小子集构建规则和轻量级成对估计,实现了在top-$m$排名反馈下的$O(n/m \ln T)$次优遗憾,以及在完整排名反馈下的$O\big((n-k)\ln T / (k\Delta_{(k)})\big)$次优遗憾,证明了紧致的下界,并展示了在更丰富反馈下性能的提升。
We consider combinatorial online learning with subset choices when only relative feedback information from subsets is available, instead of bandit or semi-bandit feedback which is absolute. Specifically, we study two regret minimisation problems over subsets of a finite ground set $[n]$, with subset-wise relative preference information feedback according to the Multinomial logit choice model. In the first setting, the learner can play subsets of size bounded by a maximum size and receives top-$m$ rank-ordered feedback, while in the second setting the learner can play subsets of a fixed size $k$ with a full subset ranking observed as feedback. For both settings, we devise instance-dependent and order-optimal regret algorithms with regret $O(\frac{n}{m} \ln T)$ and $O(\frac{n}{k} \ln T)$, respectively. We derive fundamental limits on the regret performance of online learning with subset-wise preferences, proving the tightness of our regret guarantees. Our results also show the value of eliciting more general top-$m$ rank-ordered feedback over single winner feedback ($m=1$). Our theoretical results are corroborated with empirical evaluations.
研究动机与目标
- 解决仅具有相对、序数反馈而非绝对奖励的组合在线学习问题。
- 在仅观察到子集的top-$m$排名或完整排名时,最小化子集选择的遗憾。
- 设计高效算法,利用MNL模型结构以避免遗憾的组合爆炸。
- 建立基本下界,并证明所提算法的次优性。
- 在合成MNL环境中对理论发现进行经验验证。
提出的方法
- 提出一种基于UCB的算法,采用新颖的最大最小子集构建规则,以选择有希望的子集。
- 使用Rank-Breaking方法,从top-$m$排名中提取反馈,维护$O(n^2)$项物品偏好的成对估计。
- 利用对成对偏好估计$p_{ij}$的置信区间$c_{ij}(t)$,在探索与利用之间取得平衡。
- 为固定大小子集选择引入递归变体(Rec-MaxMin-UCB),适用于完整排名反馈。
- 采用饱和阶段分析,以限制次优物品的替换,控制遗憾。
- 通过集中不等式推导遗憾边界,并利用MNL模型的结构,实现实例相关最优性。
实验结果
研究问题
- RQ1能否为仅具有相对反馈的组合Bandits设计高效的遗憾最小化算法?
- RQ2top-$m$排名反馈的长度如何影响基本遗憾极限?
- RQ3当观察到完整子集排名时,可实现的最优遗憾是多少?
- RQ4能否利用MNL模型的结构,避免遗憾的组合爆炸?
- RQ5所提算法是否具有次优性?能否通过匹配的下界证明?
主要发现
- 所提算法在top-$m$排名反馈下实现了实例相关的遗憾$O(n/m \ln T)$,该结果为次优。
- 遗憾边界与最大子集大小$k$无关,仅随反馈长度$m$的增加而改善。
- 对于大小为$k$的固定大小子集,算法实现了$O\big((n-k)\ln T / (k\Delta_{(k)})\big)$的遗憾,与推导出的下界一致。
- 固定大小情形的下界为$\Omega\big((n-k)\ln T / (k\Delta_{(k)})\big)$,证明了上界紧致性。
- 在$n=16$和$n=50$的MNL模型上的实验评估,证实了更丰富反馈带来的理论性能提升。
- 分析表明,获取top-$m$反馈优于单个胜者反馈($m=1$),遗憾实现乘法级改善。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。