Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Device User Matching Based on Massive Browse Logs: The Runner-Up Solution for the 2016 CIKM Cup

Jianxun Lian, Xing Xie|arXiv (Cornell University)|Oct 13, 2016
Spam and Phishing Detection参考文献 7被引用数 11
ひとこと要約

この論文は、2016年CIKMカップのクロスデバイスユーザーマッチングチャレンジにおけるRunner-upソリューションを提示しており、包括的な特徴工学、反復的ネガティブサンプリング、およびハイブリッドGBDT + ロジスティック回帰モデルを用いてF1スコア0.41669を達成した。アプローチは、ユーザーマッチングをバイナリ分類問題として扱い、TF-IDFベースのドキュメント類似度、時間的相関、URLレベルの特徴を活用して、大規模なブラウズログにおけるモデルの汎化性能と性能を向上させた。

ABSTRACT

As the number and variety of smart devices increase, users may use myriad devices in their daily lives and the online activities become highly fragmented. Building an accurate user identity becomes a difficult and important problem for advertising companies. The task for the CIKM Cup 2016 Track 1 was to find the same user cross multiple devices. This paper discusses our solution to the challenge. It is mainly comprised of three parts: comprehensive feature engineering, negative sampling, and model selection. For each part we describe our special steps and demonstrate how the performance is boosted. We took the second prize of the competition with an F1-score of 0.41669.

研究の動機と目的

  • 匿名化されたブラウズログを用いて、複数のデバイスにまたがる同じユーザをリンクすることに課題を解決すること。
  • クロスデバイス行動パターンをモデル化することで、断片的なデジタル行動におけるユーザーアイデンティティ解決を改善すること。
  • 大規模なユーザーマッチングに適したスケーラブルで正確なバイナリ分類フレームワークを開発すること。
  • 効果的な特徴設計、ネガティブサンプリング、アンサンブルモデリングを通じて、モデル性能を最適化すること。

提案手法

  • マッチドユーザーペアに正例、アンマッチドに負例を割り当てることで、ユーザーマッチングをバイナリ分類問題として定式化した。
  • ドキュメント類似度(DocSim:TF-IDF加重語の類似度)、イベントID類似度(FidSim)、URLパス類似度(URLSim)、時間的行動相関(HourCor)を含む包括的な特徴を設計した。
  • 弱学習器を用いて反復的ネガティブサンプリングを実装し、ハードネガティブ例を選択することで、モデルのロバスト性を向上させた。
  • 二段階モデルパイプラインを適用:まずロジスティック回帰で上位候補ペアをフィルタリングし、その後GBDTで削減された候補集合に対して最終予測を実行した。
  • ロジスティック回帰による事前フィルタリングとGBDT推論を組み合わせたハイブリッドアンサンブル戦略を採用し、計算負荷を低減するとともに精度を向上させた。
  • 提出制約を満たすために、アルゴリズム2による後処理を実施し、各ユーザごとに上位n件および近接順位のペアを選択することで、F1スコアの最適化を図った。

実験結果

リサーチクエスチョン

  • RQ1ブラウズログのみを用いたクロスデバイスユーザーマッチングにおいて、包括的な特徴工学は性能向上にどのように寄与するか?
  • RQ2極めてスパースな候補空間上で学習する際、どのネガティブサンプリング戦略がモデルの汎化性能を最大限に高めるか?
  • RQ3ロジスティック回帰とGBDTを組み合わせたハイブリッドモデルは、単一モデルベースラインを上回る性能を発揮できるか?
  • RQ4弱学習器を用いた反復的ネガティブサンプリングは、大規模分類においてモデルの収束性とF1スコアにどのように影響を与えるか?
  • RQ5提出サイズ制約下でのF1スコア最大化において、適合率と再現率の最適なトレードオフは何か?

主な発見

  • ロジスティック回帰によるフィルタリングとGBDTによる予測を組み合わせたハイブリッドモデルは、F1スコアを0.3782から0.6193まで著しく向上させ、二段階アプローチの有効性を示した。
  • 最終提出ではF1スコア0.41669を達成し、CIKMカップ2016で2位を獲得した。
  • 弱学習器を用いた反復的ネガティブサンプリングにより、モデル性能が向上した。これは、ネガティブ例の選択がモデルの汎化性能にとって極めて重要であることを示している。
  • 時間的相関(HourCor)とURLレベルの類似度(URLSim)特徴の活用が、複数デバイス間でのユーザ行動パターンの区別に有意に寄与した。
  • 各ユーザごとに上位n件および近接順位の候補を含む後処理アルゴリズム(アルゴリズム2)により、提出サイズ制限を超えない範囲でピークF1スコアを達成できた。
  • ローカルでの検証結果とオンラインF1スコアがよく一致しており、過学習は顕著ではなく、テストセットのサンプリングが効果的に行われたことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。