[论文解读] Towards Usage-based Impact Metrics: - First Results from the MESUR Project
本论文提出了首个大规模、跨机构的学术使用事件参考数据集——来自主要出版商和图书馆的超过10亿条记录,证明基于使用情况的指标(如下载量、邮件转发)可提供可靠且实时的学术影响力度量。关键发现显示,基于使用情况的网络指标(如介数中心性)与传统引文指标,尤其是基于声望的指标(如PageRank)之间存在强烈相关性,表明使用数据可提供比期刊影响因子更及时、更细致的影响力评估。
Scholarly usage data holds the potential to be used as a tool to study the dynamics of scholarship in real time, and to form the basis for the definition of novel metrics of scholarly impact. However, the formal groundwork to reliably and validly exploit usage data is lacking, and the exact nature, meaning and applicability of usage-based metrics is poorly understood. The MESUR project funded by the Andrew W. Mellon Foundation constitutes a systematic effort to define, validate and cross-validate a range of usage-based metrics of scholarly impact. MESUR has collected nearly 1 billion usage events as well as all associated bibliographic and citation data from significant publishers, aggregators and institutional consortia to construct a large-scale usage data reference set. This paper describes some major challenges related to aggregating and processing usage data, and discusses preliminary results obtained from analyzing the MESUR reference data set. The results confirm the intrinsic value of scholarly usage data, and support the feasibility of reliable and valid usage-based metrics of scholarly impact.
研究动机与目标
- 建立一个大规模、标准化的学术使用事件参考数据集,以支持对基于使用情况的影响力指标的严谨研究。
- 调查并缓解在不同出版商和机构间收集使用数据时的抽样偏差。
- 通过与既有的基于引文的指标对比,验证基于使用情况的指标的可靠性和有效性。
- 探索用实时、基于使用情况的替代指标取代或补充传统指标(如期刊影响因子)的可行性。
提出的方法
- 汇集了来自14家主要出版商、数据聚合商和机构联盟的近10亿条使用事件,包含书目和引文元数据。
- 构建了一个全面的参考数据集,作为跨指标比较的“公平竞技场”。
- 应用网络分析技术(如PageRank和介数中心性)来通过使用模式建模学术影响力。
- 采用主成分分析(PCA)评估基于使用情况和基于引文的指标之间的相互关系及潜在维度。
- 利用使用数据绘制科学地图,可视化学术网络结构,并验证基于使用情况的指标的意义。
- 使用斯皮尔曼等级相关系数评估不同影响力指标之间的收敛性和相关性。
实验结果
研究问题
- RQ1是否可以可靠地聚合和验证大规模学术使用数据,作为影响力指标的基础?
- RQ2基于使用情况的指标在可靠性和有效性方面与传统基于引文的指标(如影响因子)相比如何?
- RQ3基于使用情况的网络指标(如介数、PageRank)与基于引文的声望指标之间的相关性有多大?
- RQ4在建模学术影响力方面,使用网络相较于引文网络具有哪些结构性和表征上的优势?
- RQ5使用数据是否捕捉到了引文模式中未体现的、独立或互补的学术影响力维度?
主要发现
- MESUR参考数据集包含超过2亿条基于文章的使用事件,是目前已知规模最大的同类数据集。
- 基于使用情况的指标(如介数中心性)与基于引文的介数中心性之间的斯皮尔曼相关系数为0.71(p < 0.001),表明在衡量学术声望方面具有高度一致性。
- 基于引文的介数中心性与接近度中心性之间的相关系数仅为0.47(p < 0.001),表明引文指标本身也存在不一致性。
- 基于使用情况的指标在内部一致性与收敛性方面优于基于引文的指标,这可能是由于使用网络具有更高的密度和更丰富的结构。
- 期刊使用网络在数据密度、连通性和结构复杂性方面均优于引文网络,支持其在建模跨学科科学中的应用。
- 主成分分析结果表明,基于使用情况的指标聚类在一起,并形成一个独立的学术影响力维度,可能代表了与传统影响因子不同的但具有意义的声望概念。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。