[论文解读] Online Learning with Preference Feedback
本文提出了一种在线偏好反馈学习框架,其中算法从用户偏好(例如点击或选择)中学习,而非显式奖励。它提出了偏好感知器算法,基于呈现项目与偏好项目之间的成对比较来更新模型权重,在 $ \alpha $-信息性反馈下实现了 $ O(1/\sqrt{T}) $ 的遗憾边界,展示了在网页搜索排序任务中的优异性能。
We propose a new online learning model for learning with preference feedback. The model is especially suited for applications like web search and recommender systems, where preference data is readily available from implicit user feedback (e.g. clicks). In particular, at each time step a potentially structured object (e.g. a ranking) is presented to the user in response to a context (e.g. query), providing him or her with some unobserved amount of utility. As feedback the algorithm receives an improved object that would have provided higher utility. We propose a learning algorithm with provable regret bounds for this online learning setting and demonstrate its effectiveness on a web-search application. The new learning model also applies to many other interactive learning problems and admits several interesting extensions.
研究动机与目标
- 解决在网页搜索和推荐引擎等交互式系统中从隐式用户反馈中学习的挑战。
- 建模在线学习场景,其中反馈形式为偏好比较而非完整的效用信号。
- 在现实反馈假设下,开发具有理论遗憾保证的算法。
- 在真实世界的网页搜索排序任务中,通过基于偏好的反馈对方法进行实证验证。
提出的方法
- 该算法维护一个权重向量 $ \mathbf{w}_t $,并选择预测效用最大化的动作 $ \mathbf{y}_t $,即 $ \mathbf{w}_t^\top \phi(\mathbf{x}_t, \mathbf{y}) $。
- 在接收到偏好项目 $ \mathbf{\bar{y}}_t $ 后,模型更新为 $ \mathbf{w}_{t+1} = \mathbf{w}_t + \phi(\mathbf{x}_t, \mathbf{\bar{y}}_t) - \phi(\mathbf{x}_t, \mathbf{y}_t) $。
- 该方法假设效用函数为线性形式 $ U(\mathbf{x}, \mathbf{y}) = \mathbf{w}^{*\top} \phi(\mathbf{x}, \mathbf{y}) $,且特征范数有界,即 $ \|\phi(\mathbf{x}, \mathbf{y})\| \leq R $。
- 反馈被建模为 $ \alpha $-信息性,即反馈效用位于最优效用差距的 $ \alpha $ 分数范围内,噪声由 $ \xi_t $ 捕获。
- 通过基于线性效用模型的合成反馈和网页搜索数据集的真实相关性标签对算法进行评估。
- 遗憾度量为最优效用与呈现效用之间的平均差值,DCG*遗憾作为次要指标。
实验结果
研究问题
- RQ1如何有效将在线学习适应于仅能获取偏好反馈(如点击)的场景?
- RQ2在仅有成对反馈的情况下,学习算法能否在在线偏好学习中实现次线性遗憾?
- RQ3反馈质量(以 $ \alpha $ 衡量)如何影响学习性能和遗憾边界?
- RQ4与标准方法(如排序SVM)相比,所提出的偏好感知器在遗憾和计算成本方面表现如何?
主要发现
- 偏好感知器的遗憾边界为 $ \text{REGRET}_T \leq \frac{1}{\alpha T} \sum_{t=1}^T \xi_t + \frac{2R\|\mathbf{w}^*\|}{\alpha \sqrt{T}} $,在无噪声反馈下以 $ O(1/\sqrt{T}) $ 的速率收敛至零遗憾。
- 在 $ \alpha $-信息性反馈实验中,$ \alpha = 1.0 $ 时的遗憾显著低于 $ \alpha = 0.1 $,尽管性能差距小于预期,部分原因是某些情况下反馈强于预期。
- 使用真实相关性标签作为反馈时,该算法的平均遗憾低于定期微调的排序SVM,尽管后者是强基线。
- 偏好感知器运行时间约为30分钟,而SVM基线约需20小时,凸显了显著的计算优势。
- 在真实相关性反馈下,DCG*遗憾收敛至非零值,反映出人类相关性判断中固有的噪声和非线性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。