Skip to main content
QUICK REVIEW

[论文解读] Online Learning to Rank with List-level Feedback for Image Filtering

Chang Li, Artem Grotov|arXiv (Cornell University)|Dec 12, 2018
Domain Adaptation and Few-Shot Learning参考文献 36被引用 4
一句话总结

本文提出两种在线学习排序方法——PGLearn 和 RegLearn——用于仅使用列表级反馈的图像过滤,其中用户反馈在列表层面聚合,而非针对单个项目。RegLearn 通过回归预测列表级反馈并反向传播相关性分数,性能优于 PGLearn,尤其在列表规模较大时表现更优,并能有效从理想或低噪声反馈中学习折扣权重。

ABSTRACT

Online learning to rank (OLTR) via implicit feedback has been extensively studied for document retrieval in cases where the feedback is available at the level of individual items. To learn from item-level feedback, the current algorithms require certain assumptions about user behavior. In this paper, we study a more general setup: OLTR with list-level feedback, where the feedback is provided only at the level of an entire ranked list. We propose two methods that allow online learning to rank in this setup. The first method, PGLearn, uses a ranking model to generate policies and optimizes it online using policy gradients. The second method, RegLearn, learns to combine individual document relevance scores by directly predicting the observed list-level feedback through regression. We evaluate the proposed methods on the image filtering task, in which deep neural networks (DNNs) are used to rank images in response to a set of standing queries. We show that PGLearn does not perform well in OLTR with list-level feedback. RegLearn, instead, shows good performance in both online and offline metrics.

研究动机与目标

  • 为解决在仅提供列表级反馈而非项目级反馈时,图像过滤中在线学习排序(OLTR)的挑战。
  • 开发可基于像素特征使用深度神经网络学习的方法,避免依赖传统 OLTR 中常见的文本特征。
  • 评估在高反馈噪声或用户交互数据有限的情况下,列表级反馈下 OLTR 方法的有效性。
  • 比较基于策略梯度(PGLearn)和基于回归(RegLearn)的方法在图像排序中的在线与离线指标表现。

提出的方法

  • PGLearn 使用策略梯度方法,将排序列表建模为动作,并基于强化学习中的列表级反馈优化排序策略。
  • RegLearn 通过回归头将单个文档相关性分数组合,直接预测列表级反馈(如点击率或 nDCG)。
  • 两种方法均使用深度神经网络作为底层排序模型,处理图像特征并生成相关性分数。
  • RegLearn 通过反向传播更新排序模型,基于预测与观测到的列表级反馈之间的差异。
  • 在 MSCOCO 数据集上使用不同配置的模拟反馈对方法进行评估:理想情况(nDCG@k)和噪声情况(CTR@k)。
  • 在线训练期间使用探索策略,如 ε-贪婪(ε=0.1),以平衡探索与利用。

实验结果

研究问题

  • RQ1当反馈仅在列表级别提供而非针对单个项目时,能否有效应用在线学习排序于图像过滤?
  • RQ2在学习列表级反馈时,PGLearn 与 RegLearn 的性能表现如何比较,尤其是在列表规模增大时?
  • RQ3RegLearn 能否从列表级反馈中学习到正确的折扣权重(如 nDCG 所需)和查看概率(如点击模型所需)?
  • RQ4反馈噪声如何影响 RegLearn 学习可靠排序模型的能力?
  • RQ5对用户行为的先验知识(如查看概率)是否能提升 RegLearn 的性能?

主要发现

  • 在 ε=0.1 时,RegLearn 在理想配置和定位点击配置下的平均 nDCG@5 分别达到 0.67±0.01 和 0.66±0.00,表现出强劲的在线性能。
  • 当列表规模超过 2 时,PGLearn 表现不佳,尽管其设计用于策略梯度优化,但无法泛化到更大列表。
  • 在理想 nDCG 反馈下,RegLearn 学习到的折扣权重接近真实值(欧氏距离 0.079),表明其对排序质量建模准确。
  • 在噪声点击反馈下,RegLearn 性能下降:与真实权重的欧氏距离分别为 0.231(理想)和 0.372(定位),在最噪声的(娱乐型)配置下完全失效。
  • OracleLearn(利用查看概率的先验知识)始终提升性能,表明引入用户行为先验可增强学习效果。
  • 纯探索(ε=1)会阻止 RegLearn 有效训练,表明平衡探索(ε=0.1)对成功学习至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。