Skip to main content
QUICK REVIEW

[论文解读] Active Ranking with Subset-wise Preferences

Aadirupa Saha, Aditya Gopalan|ePrints@IISc (Indian Institute of Science)|Oct 23, 2018
Auction Theory and Applications被引用 5
一句话总结

本文提出了一种针对 $n$ 个项目的主动排序算法,基于普莱克特-卢克(Plackett-Luce)模型下的子集偏好反馈。该方法引入了一种新颖的基于枢纽点(pivot-based)的方法,仅维护 $n$ 个项目的得分估计,而非传统的 $O(n^2)$ 对比估计,当每个子集中观察到前 $m$ 名排名时,实现了样本复杂度的 $m$ 倍降低,且理论边界紧致,表明该改进在阶上是最优的。

ABSTRACT

We consider the problem of probably approximately correct (PAC) ranking $n$ items by adaptively eliciting subset-wise preference feedback. At each round, the learner chooses a subset of $k$ items and observes stochastic feedback indicating preference information of the winner (most preferred) item of the chosen subset drawn according to a Plackett-Luce (PL) subset choice model unknown a priori. The objective is to identify an $ε$-optimal ranking of the $n$ items with probability at least $1 - δ$. When the feedback in each subset round is a single Plackett-Luce-sampled item, we show $(ε, δ)$-PAC algorithms with a sample complexity of $O\left(\frac{n}{ε^2} \ln \frac{n}δ ight)$ rounds, which we establish as being order-optimal by exhibiting a matching sample complexity lower bound of $Ω\left(\frac{n}{ε^2} \ln \frac{n}δ ight)$---this shows that there is essentially no improvement possible from the pairwise comparisons setting ($k = 2$). When, however, it is possible to elicit top-$m$ ($\leq k$) ranking feedback according to the PL model from each adaptively chosen subset of size $k$, we show that an $(ε, δ)$-PAC ranking sample complexity of $O\left(\frac{n}{m ε^2} \ln \frac{n}δ ight)$ is achievable with explicit algorithms, which represents an $m$-wise reduction in sample complexity compared to the pairwise case. This again turns out to be order-wise unimprovable across the class of symmetric ranking algorithms. Our algorithms rely on a novel {pivot trick} to maintain only $n$ itemwise score estimates, unlike $O(n^2)$ pairwise score estimates that has been used in prior work. We report results of numerical experiments that corroborate our findings.

研究动机与目标

  • 开发高效的主动排序算法,以最小化识别出 $ε$-最优排序所需的子集比较轮数,且在高概率下保证结果正确。
  • 解决从子集偏好反馈中学习项目排序的挑战,其中每个子集中仅能观察到单一胜者或前 $m$ 名项目。
  • 在普莱克特-卢克模型下,为仅胜者反馈与前 $m$ 名反馈两种情形建立理论上的样本复杂度边界。
  • 证明前 $m$ 名反馈相比仅胜者反馈可实现 $m$ 倍的样本复杂度降低,且该改进在信息论上是最优的。

提出的方法

  • 利用普莱克特-卢克模型的无关选项独立性(IIA)特性,仅维护 $n$ 个项目的个体得分估计,避免传统方法中 $O(n^2)$ 的成对估计负担。
  • 提出一种新颖的枢纽点技巧:动态将项目集合划分为包含共同枢纽点的子集,学习相对于枢纽点的局部排序,并一致地合并结果。
  • 利用切尔诺夫-胡夫丁(Chernoff-Hoeffding)不等式,基于子集轮次中的实际胜出次数,推导出对项目得分估计的紧致置信区间。
  • 采用排名拆分(rank-breaking)更新机制,将前 $m$ 名反馈转化为成对比较,用于得分估计,同时保持统计效率。
  • 通过精心构造的混淆实例,应用测度变换论证,推导出样本复杂度的信息论下界。
  • 设计了明确的算法(如 Beat-the-Pivot),在仅胜者与前 $m$ 名反馈两种情形下均达到所推导的样本复杂度边界。

实验结果

研究问题

  • RQ1在仅提供胜者反馈的情况下,基于子集偏好的主动排序能否实现优于成对比较的样本复杂度?
  • RQ2在普莱克特-卢克模型下,仅胜者反馈的主动排序的根本样本复杂度极限是什么?
  • RQ3若每个子集中观察到前 $m$ 名项目(而非仅胜者),是否能实现样本复杂度的可证明降低?
  • RQ4对于所有对称排序算法,前 $m$ 名反馈是否能实现 $m$ 倍的样本复杂度降低,且该降低在阶上是最优的?
  • RQ5基于枢纽点的方法能否在仅维护 $O(n)$ 个得分估计的同时,确保在普莱克特-卢克模型下全局排序估计的一致性?

主要发现

  • 对于仅胜者反馈,样本复杂度为 $O\left(\frac{n}{\epsilon^{2}}\ln\frac{n}{\delta}\right)$,与下界 $\Omega\left(\frac{n}{\epsilon^{2}}\ln\frac{n}{\delta}\right)$ 匹配,证明无法在成对比较之外实现进一步改进。
  • 在前 $m$ 名反馈下,样本复杂度降低至 $O\left(\frac{n}{m\epsilon^{2}}\ln\frac{n}{\delta}\right)$,相比仅胜者反馈实现了 $m$ 倍的改进。
  • 该改进的样本复杂度在阶上是紧致的,因为已建立匹配的下界 $\Omega\left\{\frac{n}{m\epsilon^{2}}\ln\frac{n}{\delta}\right\}$。
  • 所提出的基于枢纽点的算法仅维护 $n$ 个项目的个体得分估计,避免了以往工作中常见的 $O(n^2)$ 成对估计开销。
  • 数值实验表明,所提算法在合成环境中能够达到理论上的样本复杂度边界。
  • 分析表明,$m$ 倍的复杂度降低是本质性的,即使采用更复杂的反馈机制或算法,也无法进一步改进。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。