Skip to main content
QUICK REVIEW

[论文解读] Cross-Device User Matching Based on Massive Browse Logs: The Runner-Up Solution for the 2016 CIKM Cup

Jianxun Lian, Xing Xie|arXiv (Cornell University)|Oct 13, 2016
Spam and Phishing Detection参考文献 7被引用 11
一句话总结

本论文展示了2016年CIKM Cup跨设备用户匹配挑战赛的亚军解决方案,采用全面的特征工程、迭代负采样以及GBDT + 逻辑回归的混合模型,实现了0.41669的F1分数。该方法将用户匹配问题视为二分类问题,利用基于TF-IDF的文档相似性、时间相关性以及URL级别特征,提升模型在大规模浏览日志上的泛化能力与性能。

ABSTRACT

As the number and variety of smart devices increase, users may use myriad devices in their daily lives and the online activities become highly fragmented. Building an accurate user identity becomes a difficult and important problem for advertising companies. The task for the CIKM Cup 2016 Track 1 was to find the same user cross multiple devices. This paper discusses our solution to the challenge. It is mainly comprised of three parts: comprehensive feature engineering, negative sampling, and model selection. For each part we describe our special steps and demonstrate how the performance is boosted. We took the second prize of the competition with an F1-score of 0.41669.

研究动机与目标

  • 解决利用匿名浏览日志在多个设备间关联同一用户的问题。
  • 通过建模跨设备活动模式,提升在碎片化数字行为中的用户身份解析能力。
  • 构建可扩展且精确的二分类框架,用于大规模用户匹配。
  • 通过有效的特征设计、负采样和集成建模优化模型性能。

提出的方法

  • 将用户匹配问题建模为二分类问题,匹配用户对标记为正样本,未匹配对标记为负样本。
  • 设计了全面的特征,包括DocSim(基于TF-IDF加权词相似性)、FidSim(事件ID相似性)、URLSim(URL路径相似性)以及HourCor(时间行为相关性)。
  • 采用弱学习器迭代选择难负样本的负采样策略,提升模型鲁棒性。
  • 实施两阶段模型流程:先用逻辑回归筛选候选对,再在精简后的候选集中使用GBDT进行最终预测。
  • 采用混合集成策略,由逻辑回归在GBDT推理前预过滤候选对,降低计算负载并提升精度。
  • 通过算法2进行后处理,为每位用户选择top-n及附近排名的候选对,优化在提交大小限制下的F1分数。

实验结果

研究问题

  • RQ1如何通过全面的特征工程提升仅使用浏览日志进行跨设备用户匹配的性能?
  • RQ2在大规模稀疏候选空间上训练时,何种负采样策略能最大化模型泛化能力?
  • RQ3结合逻辑回归与GBDT的混合模型是否能在用户链接任务中超越单一模型基线?
  • RQ4使用弱学习器进行迭代负采样对大规模分类中的模型收敛性和F1分数有何影响?
  • RQ5在提交大小限制下,F1分数最大化的最优精确率与召回率权衡是什么?

主要发现

  • 逻辑回归预过滤后接GBDT预测的混合模型,使F1分数从0.3782显著提升至0.6193,证明了两阶段方法的有效性。
  • 最终提交结果达到F1分数0.41669,在CIKM Cup 2016竞赛中获得第二名。
  • 利用弱学习器迭代选择难负样本的负采样策略提升了模型性能,表明负样本选择对模型泛化至关重要。
  • 时间相关性(HourCor)和URL级别相似性(URLSim)特征在区分跨设备用户行为模式方面起到了关键作用。
  • 后处理算法(算法2)通过包含每位用户的top-n及附近排名的候选对,实现了峰值F1分数,且未超过提交大小限制。
  • 本地验证结果与在线F1分数高度一致,表明无显著过拟合,且测试集采样有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。