[论文解读] ChoiceRank: Identifying Preferences from Node Traffic in Networks
ChoiceRank 提出了一种可扩展的方法,仅通过聚合的节点级流量和网络结构即可推断网络中的边转移概率,通过 Luce 选择公理对用户选择进行建模。该方法采用具有良好定义的贝叶斯推断框架,并结合一种高效的 EM 类算法,可扩展至百亿节点图,在点击流和出行数据集上准确恢复了真实转移概率。
Understanding how users navigate in a network is of high interest in many applications. We consider a setting where only aggregate node-level traffic is observed and tackle the task of learning edge transition probabilities. We cast it as a preference learning problem, and we study a model where choices follow Luce's axiom. In this case, the $O(n)$ marginal counts of node visits are a sufficient statistic for the $O(n^2)$ transition probabilities. We show how to make the inference problem well-posed regardless of the network's structure, and we present ChoiceRank, an iterative algorithm that scales to networks that contains billions of nodes and edges. We apply the model to two clickstream datasets and show that it successfully recovers the transition probabilities using only the network structure and marginal (node-level) traffic data. Finally, we also consider an application to mobility networks and apply the model to one year of rides on New York City's bicycle-sharing system.
研究动机与目标
- 在仅能获取聚合的节点级流量和网络结构时,推断网络中的边转移概率。
- 解决用户偏好(内在点击倾向)与可见性(通过传入链接暴露)之间难以区分的问题。
- 开发一种对任意网络结构均鲁棒的良好定义的推断框架。
- 在单台机器上实现对大规模网络(包括百亿条边图)的可扩展推断。
- 在真实世界数据集(包括点击流和出行网络)上验证该方法。
提出的方法
- 将用户导航建模为由 Luce 选择公理控制的一系列选择,其中每个节点具有反映内在偏好的潜在强度参数。
- 使用节点访问次数的边缘分布作为估计潜在强度参数的充分统计量,从而无需边级转移日志。
- 在强度参数上引入共轭先验(伽马分布),以确保无论网络拓扑如何,推断问题均具有良好定义。
- 采用一种迭代最小化-最大化(MM)算法,等价于 EM 算法,以计算节点强度的最大后验估计。
- 推导出仅需每步两次类似 PageRank 的迭代的更新规则,从而实现每轮迭代的线性时间复杂度。
- 将算法适配至加权边网络,并支持流式边处理以提升可扩展性。
实验结果
研究问题
- RQ1仅从节点级流量计数和网络结构中,能否准确恢复边转移概率?
- RQ2在网络导航中,如何将用户偏好(内在强度)与可见性效应(通过传入链接暴露)分离开来?
- RQ3在使用共轭先验的贝叶斯框架下,对于任意网络拓扑,推断问题是否具有良好定义?
- RQ4该推断算法能否在单台机器上扩展至包含数十亿个节点和边的大型网络?
- RQ5该模型是否能泛化至点击流数据之外的其他导航模式,例如出行网络?
主要发现
- 节点访问次数的边缘分布是潜在强度参数的充分统计量,使得无需边级数据即可实现完整推断。
- 引入伽马先验可确保在任何网络结构下推断问题均具有良好定义,避免了可识别性问题。
- ChoiceRank 算法收敛至最大后验估计,并具有高效可扩展性,每步仅需两次 PageRank 迭代的计算开销。
- 在 Wikipedia 和匈牙利新闻门户上,该模型仅使用节点级流量和图结构,即以高精度恢复了边转移概率。
- 该方法成功推断了纽约市自行车共享系统中的出行模式,证明其在网页点击流之外的应用潜力。
- 该算法在单台机器上处理了包含超过 1000 亿条边的 WWW 超链接图快照,证实了其可扩展性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。