QUICK REVIEW
[论文解读] Classification and Learning-to-rank Approaches for Cross-Device Matching at CIKM Cup 2016
Nam Khanh Tran|arXiv (Cornell University)|Dec 20, 2016
Industrial Vision Systems and Defect Detection参考文献 5被引用 6
一句话总结
本文提出了两种跨设备用户匹配的方法:一种基于集成学习的二分类方法,另一种基于贪心预测算法的排序学习方法。其中,排序学习方法在调整预测集合大小后表现更优,在CIKM Cup 2016测试排行榜上取得了0.36110的F1分数,证明了其在利用浏览和点击数据识别跨设备用户方面具有更优性能。
ABSTRACT
In this paper, we propose two methods for tackling the problem of cross-device matching for online advertising at CIKM Cup 2016. The first method considers the matching problem as a binary classification task and solve it by utilizing ensemble learning techniques. The second method defines the matching problem as a ranking task and effectively solve it with using learning-to-rank algorithms. The results show that the proposed methods obtain promising results, in which the ranking-based method outperforms the classification-based method for the task.
研究动机与目标
- 为解决在线广告中准确关联用户跨设备身份的挑战。
- 开发可扩展且高效的算法,从匿名浏览日志和点击数据中识别匹配的用户档案。
- 比较二分类方法与排序学习方法在跨设备匹配中的有效性。
- 通过利用共享事实和域名优化预测集合生成,降低计算成本。
- 通过集成学习和基于贪心算法的预测排序提升模型性能。
提出的方法
- 将跨设备匹配问题建模为二分类任务,基于从共享事实和域名中提取的特征,使用xgboost、神经网络和随机森林进行集成学习。
- 采用基于共享事实/域名的负采样策略生成真实的负样本训练对,避免从整个用户池中随机采样。
- 将问题表示为排序学习任务,通过用户对的相似度进行排序,使用xgboost进行排序,特征来自URL和标题的词元。
- 提出一种贪心算法生成最终预测,需满足两个约束:每个测试用户必须至少与另一个用户关联,且连通分量的分布需与训练数据一致。
- 基于共享事实(URL和标题)和共享域名进行特征工程,构建分类与排序模型的输入向量。
- 使用包含167,055对正样本和215,307对正样本的验证集与测试集,并通过调整预测集合大小以最大化F1分数。
实验结果
研究问题
- RQ1集成学习能否通过共享浏览行为提升二分类方法在跨设备用户匹配中的性能?
- RQ2排序学习方法是否在识别跨设备用户身份方面优于二分类方法?
- RQ3贪心算法在生成保留训练图结构特性的预测集合方面效果如何?
- RQ4调整预测对数量在多大程度上能提升最终排行榜的F1分数?
- RQ5共享事实与域名在区分跨设备匹配与非匹配用户对方面起到多大作用?
主要发现
- 排序学习方法在CIKM Cup 2016测试排行榜上取得了0.36110的F1分数,优于所有基于分类的方法。
- 经过调整预测对数量的贪心预测算法(rank2-tuned)在所有提交结果中取得最高F1分数,证明了预测集合大小优化的重要性。
- 在分类方法中采用堆叠集成学习后,F1分数相比单个模型有所提升,其中xgboost在第二层表现最佳。
- 基于排序的方法优于基于分类的方法,F1分数分别为0.42038(Rank1)与0.29229(分类基线)。
- 训练数据中共享事实与域名的分布显示,98.5%的用户对至少共享一个事实或域名,支持使用此类特征进行建模。
- 所提出的负采样方法通过将负样本限制在共享事实或域名的用户中,高效生成了350万对训练样本,显著降低了计算成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。