Skip to main content
QUICK REVIEW

[论文解读] RecSys Challenge 2016: job recommendations based on preselection of offers and gradient boosting

Andrzej Pacuk, Piotr Sankowski|arXiv (Cornell University)|Dec 3, 2016
Data Mining Algorithms and Applications参考文献 3被引用 16
一句话总结

本文提出了一种针对 Xing.com 的两阶段工作推荐方法,首先对候选职位进行预筛选,随后使用梯度提升(XGBoost)预测用户互动概率。该方法在 RecSys Challenge 2016 中获得第二名,公开排行榜得分为 675,985.03,私有排行榜得分为 2,035,964.16,通过有效结合复杂特征与模型融合策略,为每位用户生成前 30 名的推荐结果。

ABSTRACT

We present the Mim-Solution's approach to the RecSys Challenge 2016, which ranked 2nd. The goal of the competition was to prepare job recommendations for the users of the website Xing.com. Our two phase algorithm consists of candidate selection followed by the candidate ranking. We ranked the candidates by the predicted probability that the user will positively interact with the job offer. We have used Gradient Boosting Decision Trees as the regression tool.

研究动机与目标

  • 基于匿名的互动与曝光数据,为 Xing.com 用户开发一种可扩展且准确的工作推荐系统。
  • 解决在大量可能的用户-项目配对中,高效预测用户对职位的互动行为的挑战。
  • 通过在应用机器学习模型前聚焦于预筛选的候选职位子集,提升推荐质量。
  • 针对竞赛自定义的评估指标进行优化,该指标强调高排名处的精确率与用户成功率。
  • 探索多样化特征(基于内容、协同过滤、时间与流行度)对互动预测性能的影响。

提出的方法

  • 该方案采用两阶段流水线:首先,基于用户与项目属性的启发式过滤器,为每位用户预筛选候选职位,将搜索空间从 150K×327K 缩减至可管理的子集。
  • 其次,训练梯度提升决策树(XGBoost)以预测用户对每个候选职位产生积极互动的概率,使用大量工程化特征。
  • 特征包括基于内容的相似性(例如,职业层级差异、职位角色与标题重叠)、协同过滤信号(例如,与已点击项目的最大相似度)、时间特征(例如,上次互动以来的时间)以及流行度趋势。
  • 通过时间戳偏移,确保训练数据与测试数据之间的时间特征分布一致,实现精确对齐。
  • 通过平均多个 XGBoost 模型的预测概率,应用模型融合策略,以提升鲁棒性与泛化能力。
  • 最终推荐通过按平均预测概率对候选项目排序并选取前 30 名生成,排除用户已删除的项目。

实验结果

研究问题

  • RQ1可扩展的两阶段推荐流水线在稀疏互动数据的大规模职位推荐任务中,如何提升性能?
  • RQ2工程化特征(尤其是时间、协同过滤与基于内容的信号)在梯度提升模型中的预测能力提升方面,其作用程度如何?
  • RQ3候选职位的预筛选是否能显著降低训练与推理成本,同时保持高推荐准确率?
  • RQ4通过概率平均实现的模型融合在提升泛化能力与在 RecSys Challenge 评估指标下的排名性能方面,效果如何?
  • RQ5候选选择与候选排序在整体推荐系统性能中的相对贡献是什么?

主要发现

  • 该方法在 RecSys Challenge 2016 中获得第二名,公开排行榜得分为 675,985.03,私有排行榜得分为 2,035,964.16。
  • 模型在候选排序阶段达到了最佳可能得分的 77.5%,表明其在排序推荐方面表现强劲。
  • 候选选择阶段仅达到最佳可能得分的 37%,表明预筛选策略仍有显著改进空间。
  • 通过多个 XGBoost 预测结果的算术平均实现的模型融合,提升了鲁棒性,并对顶级性能有显著贡献。
  • 时间特征与协同过滤特征(如上次互动以来的时间、与之前点击项目之间的相似度)是最具预测力的特征之一。
  • 预筛选策略将用户-项目配对数量从 150K×327K 减少至可处理的规模,使复杂特征集的高效训练与推理成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。