Skip to main content
QUICK REVIEW

[論文レビュー] RecSys Challenge 2016: job recommendations based on preselection of offers and gradient boosting

Andrzej Pacuk, Piotr Sankowski|arXiv (Cornell University)|Dec 3, 2016
Data Mining Algorithms and Applications参考文献 3被引用数 16
ひとこと要約

本論文は、Xing.comにおける求人推薦のための2段階アプローチを提示している。まず候補求人を事前に選別し、その後XGBoostを用いてユーザーのインタラクション確率を予測する。この手法はRecSys Challenge 2016で2位を達成し、公開リーダーボードで675,985.03、非公開リーダーボードで2,035,964.16のスコアを記録した。複雑な特徴量の統合とモデルブレンドを効果的に行い、ユーザーごとに上位30件の求人をランク付けした。

ABSTRACT

We present the Mim-Solution's approach to the RecSys Challenge 2016, which ranked 2nd. The goal of the competition was to prepare job recommendations for the users of the website Xing.com. Our two phase algorithm consists of candidate selection followed by the candidate ranking. We ranked the candidates by the predicted probability that the user will positively interact with the job offer. We have used Gradient Boosting Decision Trees as the regression tool.

研究の動機と目的

  • 匿名化されたインタラクションおよびインプレッションデータに基づき、Xing.comユーザー向けにスケーラブルかつ高精度な求人推薦システムを開発すること。
  • 膨大なユーザー・アイテムペアの存在を踏まえ、スケール上で効率的に求人オファーに対するユーザーのインタラクションを予測する課題に対処すること。
  • 機械学習モデルを適用する前に、候補求人オファーのサブセットに焦点を当てることで、推薦品質を向上させること。
  • 上位順位での精度とユーザーの成功を重視するコンペティション独自の評価指標に最適化すること。
  • コンテンツベース、協調フィルタリング、時間的要因、人気度ベースの多様な特徴量が、インタラクション予測パフォーマンスに与える影響を調査すること。

提案手法

  • ソリューションは2段階のパイプラインを採用している:まず、ユーザーおよびアイテムの属性に基づくヒューリスティックフィルタを用いて、ユーザーごとに候補求人オファーを事前に選別し、探索空間を150K×327Kから管理可能なサブセットに削減する。
  • 次に、勾配ブースティング決定木(XGBoost)を用いて、各候補求人オファーについてユーザーが肯定的にインタラクションを行う確率を予測する。広範な特徴量工学を用いている。
  • 特徴量には、コンテンツベースの類似度(例:キャリアレベルの差、職務役割および職名の重複)、協調フィルタリング信号(例:クリック済みアイテムとの最大類似度)、時間的特徴(例:最終インタラクションからの経過時間)、人気トレンドが含まれる。
  • トレーニングデータとテストデータの間で時間的特徴を正確に一致させるために、タイムスタンプをずらして両データセットの分布を一貫させた。
  • ロバストネスと一般化性能を向上させるために、複数のXGBoostモデルの予測確率を平均化するブレンド戦略を適用した。
  • 最終的な推薦は、平均化された予測確率の順に候補アイテムをソートし、上位30件を生成した。ユーザーが削除したアイテムは除外した。

実験結果

リサーチクエスチョン

  • RQ1スケーラブルな2段階推薦パイプラインは、疎なインタラクションデータを伴う大規模な求人推薦タスクにおいて、どのようにパフォーマンスを向上させ得るか?
  • RQ2特に時間的、協調フィルタリング、コンテンツベースの信号を含む特徴量工学は、勾配ブースティングモデルの予測力にどの程度寄与するか?
  • RQ3事前選別による候補求人オファーの絞り込みは、トレーニングおよびインファレンスコストを顕著に削減しつつ、高い推薦精度を維持できるか?
  • RQ4確率の平均化によるモデルブレンドは、RecSys Challengeの評価指標に基づく一般化性能およびランク付けパフォーマンスをどの程度向上させるか?
  • RQ5全体の推薦システムパフォーマンスにおいて、候補選別と候補ランク付けの相対的貢献度は何か?

主な発見

  • 本手法はRecSys Challenge 2016で2位を達成し、公開リーダーボードで675,985.03、非公開リーダーボードで2,035,964.16のスコアを記録した。
  • 候補ランク付けフェーズでは、最良スコアの77.5%を達成しており、推薦順序付けのパフォーマンスが非常に高いことが示された。
  • 候補選別フェーズでは最良スコアの37%にとどまり、事前選別の戦略に改善の余地が大きいことが示された。
  • 複数のXGBoost予測の算術平均によるモデルブレンドは、ロバストネスを向上させ、上位パフォーマンスを達成する要因となった。
  • 時間的および協調フィルタリング特徴量、特に最終インタラクションからの経過時間や、以前にクリックしたアイテムとの類似度は、最も予測力の高い特徴量の一部であった。
  • 事前選別を用いることで、ユーザー・アイテムペアの数を150K×327Kから管理可能なサイズに削減し、複雑な特徴量セットを用いた効率的なトレーニングとインファレンスを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。