[论文解读] On Multilabel Classification and Ranking with Partial Feedback
本文提出了一种新颖的多标签与排序算法,适用于部分反馈设置,利用二阶下降法与置信上界来平衡探索与利用。在广义线性模型下,其遗憾界达到 $O(T^{1/2}/\log T)$,优于先前结果,并在真实世界数据集上与全信息基线方法表现相当。
We present a novel multilabel/ranking algorithm working in partial information settings. The algorithm is based on 2nd-order descent methods, and relies on upper-confidence bounds to trade-off exploration and exploitation. We analyze this algorithm in a partial adversarial setting, where covariates can be adversarial, but multilabel probabilities are ruled by (generalized) linear models. We show O(T^{1/2} log T) regret bounds, which improve in several ways on the existing results. We test the effectiveness of our upper-confidence scheme by contrasting against full-information baselines on real-world multilabel datasets, often obtaining comparable performance.
研究动机与目标
- 解决在仅观察到有限用户反馈的条件下,多标签分类与排序问题。
- 开发一种学习算法,有效平衡在具有协变量的半对抗性设置下的探索与利用。
- 在广义线性模型背景下,实现比现有方法更紧致的遗憾界。
- 通过校准的得分值实现相关与非相关标签之间的自动阈值划分。
- 在未来工作中将该框架扩展至结构化输出任务,如层次分类。
提出的方法
- 该算法使用基于逆协方差矩阵的自适应正则化的二阶下降方法。
- 通过置信上界引导探索,置信区间由累积特征矩阵的逆推导得出。
- 利用涉及 $\boldsymbol{x}_t^\top A_{i,t}^{-1} \boldsymbol{x}_t$ 的项对置信界进行校准,确保遗憾增长有界。
- 该方法将多标签损失与标签生成模型解耦,允许灵活的损失函数。
- 根据不确定性估计动态调整探索程度,并通过置信区间上限防止高估。
- 该算法以轮次运行:接收上下文 $\boldsymbol{x}_t$,输出一个排序子集 $\hat{Y}_t$,并仅观察到 $Y_t \cap \hat{Y}_t$。
实验结果
研究问题
- RQ1我们能否在使用二阶方法的情况下,于部分反馈设置中实现多标签与排序问题的次线性遗憾?
- RQ2置信上界如何能有效适应具有部分反馈的结构化、多标签动作空间?
- RQ3在协变量为对抗性但标签概率遵循广义线性模型的半对抗性设置下,可证明的遗憾界是什么?
- RQ4该算法能否在无显式监督的情况下自动推断相关/非相关标签的阈值?
- RQ5在真实世界多标签数据集上,其性能与全信息基线相比如何?
主要发现
- 在广义线性模型假设下,该算法实现了 $O(T^{1/2}\log T)$ 的遗憾界,优于先前的 $T^{2/3}$ 类型遗憾界。
- 该遗憾界是在协变量为对抗性但标签概率遵循广义线性模型的半对抗性设置下推导得出的。
- 尽管仅接收部分反馈,该方法在真实世界多标签数据集上的性能与全信息基线方法相当。
- 置信区间构造确保了估计误差的有界增长,满足 $\sum_{t=1}^T \epsilon_{i,t}^2 \leq M$(对所有 $i \in [K]$),其中 $M = 2C d \ln(1 + T/d)$。
- 该算法通过校准得分 $\hat{p}_{i,t}$ 实现标签阈值的自动推断,从而实现相关与非相关标签之间的自动排序分离。
- 理论分析表明,遗憾界被限制在 $O(\sqrt{M S K T})$,在标准假设下可简化为 $O(T^{1/2}\log T)$。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。