[论文解读] A Weighted Correlation Index for Rankings with Ties
本文提出了一种基于Kendall’s τ的加权相关指数,将该度量推广至可处理评分向量中的 tied rankings(排名并列)情形,尤其适用于大规模图结构。通过引入加法和乘法加权方案——特别是双曲加权——该方法增强了对顶部排名项一致性的敏感度,利用广义的Knight算法实现 O(n log n) 计算,并在与人工判断的轶事性排名对比中展现出优于标准 τ 的一致性。
Understanding the correlation between two different scores for the same set of items is a common problem in information retrieval, and the most commonly used statistics that quantifies this correlation is Kendall's $τ$. However, the standard definition fails to capture that discordances between items with high rank are more important than those between items with low rank. Recently, a new measure of correlation based on average precision has been proposed to solve this problem, but like many alternative proposals in the literature it assumes that there are no ties in the scores. This is a major deficiency in a number of contexts, and in particular while comparing centrality scores on large graphs, as the obvious baseline, indegree, has a very large number of ties in web and social graphs. We propose to extend Kendall's definition in a natural way to take into account weights in the presence of ties. We prove a number of interesting mathematical properties of our generalization and describe an $O(n\log n)$ algorithm for its computation. We also validate the usefulness of our weighted measure of correlation using experimental data.
研究动机与目标
- 为解决标准 Kendall’s τ 在处理并列排名时的局限性,特别是在大规模图分析中并列排名普遍存在的情形下。
- 开发一种加权相关度量,优先考虑顶部排名项之间的一致性,以反映信息检索和网络分析中的现实直觉。
- 将 Knight 的 O(n log n) 算法推广至支持加法和乘法加权方案的 Kendall’s τ 计算。
- 在真实图数据集(如 Wikipedia、好莱坞共演网络、Common Crawl 主机图)上验证新度量,证明其与人类直觉的对齐程度优于标准 τ。
- 证明该新度量可揭示此前未被注意到的相关性,例如在不可达子图中 PageRank 与接近度之间的强相关性。
提出的方法
- 通过基于项目排名为非一致对分配权重,扩展 Kendall’s τ,采用加法双曲或乘法加权函数。
- 将广义的 τ_w 定义为一致对与非一致对的加权和,并归一化至 [-1, 1] 范围,确保数学一致性。
- 应用改进的稳定排序算法,在 O(n log n) 时间内计算加权相关性,将 Knight 算法推广至非均匀权重情形。
- 使用加法双曲权重 w(i) = 1 / log(1 + ρ(i)) 强调顶部排名项,其中 ρ(i) 为项目 i 的排名。
- 利用该算法高效计算所提出的加权 τ 和平均精度(AP)相关性。
- 采用 LAW 软件库进行实现,并以 GNU GPL 许可证开源发布。
实验结果
研究问题
- RQ1如何在保持 Kendall’s τ 解释性及归一化至 [-1, 1] 的前提下,将其推广以处理并列排名?
- RQ2与标准 τ 相比,加权相关度量在多大程度上提升了与人类对顶部列表相似性感知的一致性?
- RQ3当权重以加法或乘法方式依赖于项目排名时,能否设计出高效的 O(n log n) 算法用于加权 Kendall’s τ?
- RQ4在采用以顶部为重点的加权方案时,图中心性度量(如 PageRank 与接近度)之间会揭示出哪些新见解?
- RQ5所提出的度量是否能检测到现实网络中此前未被察觉的相关性,例如在小型、密集且不可达的子图中?
主要发现
- 所提出的双曲加权 τ(τ_h)在 PageRank 与入度之间揭示出强相关性(高于 0.9),与经验观察一致,而标准 τ 则低估了这种相似性。
- 新度量在好莱坞共演图中不可达子图的小型组件上检测到 PageRank 与接近度之间此前未被察觉的相关性,解释了 PageRank 对密集小型社区的偏向性。
- 在 Common Crawl 主机图中,τ_h 正确识别出 PageRank 对小型孤立组件赋予了过高的排名,这与 PageRank 对组件大小不敏感的特性一致。
- 该算法以 O(n log n) 时间计算加权相关性,支持大规模图的可扩展性,性能可通过并行或分布式执行(如 MapReduce)进一步提升。
- 该方法可推广至 AP 相关性,允许使用相同的算法框架高效计算基于平均精度的度量。
- 加法双曲加权方案支持对顶部 k 个列表相似性的细粒度评估,其中权重取决于项目是否位于顶部 k 内及其内部排名位置。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。