Skip to main content
QUICK REVIEW

[论文解读] Assigning credit to scientific datasets using article citation networks

Tong Zeng, Longfeng Wu|arXiv (Cornell University)|Jan 16, 2020
Scientific Computing and Data Management参考文献 55被引用 4
一句话总结

本文提出 DataRank,一种网络流算法,通过以不同方式建模出版物与数据集之间的引用流动,为科学数据集分配信用。该方法在预测实际使用情况(如 GenBank 网站访问量和 Figshare 下载量)方面优于其他方法,表明数据集具有独特的引用动态,且无需显式引用数据集即可有意义地进行排名。

ABSTRACT

A citation is a well-established mechanism for connecting scientific artifacts. Citation networks are used by citation analysis for a variety of reasons, prominently to give credit to scientists' work. However, because of current citation practices, scientists tend to cite only publications, leaving out other types of artifacts such as datasets. Datasets then do not get appropriate credit even though they are increasingly reused and experimented with. We develop a network flow measure, called DataRank, aimed at solving this gap. DataRank assigns a relative value to each node in the network based on how citations flow through the graph, differentiating publication and dataset flow rates. We evaluate the quality of DataRank by estimating its accuracy at predicting the usage of real datasets: web visits to GenBank and downloads of Figshare datasets. We show that DataRank is better at predicting this usage compared to alternatives while offering additional interpretable outcomes. We discuss improvements to citation behavior and algorithms to properly track and assign credit to datasets.

研究动机与目标

  • 解决尽管科学数据集对可重现性和再利用至关重要,却缺乏系统性信用分配的问题。
  • 开发一种方法,仅通过出版物引用网络推断数据集影响力,而无需改变引用行为。
  • 在引用网络中对出版物和数据集的不同过时率进行建模,以改进影响力估计。
  • 使用来自 GenBank 和 Figshare 的真实数据集验证该方法,通过与实际使用指标对比衡量预测准确性。
  • 提供一种可扩展、可解释的框架,用于对数据集进行排名,支持科学领域内更公平的评估与政策制定。

提出的方法

  • 该方法通过引入两种不同的节点类型(出版物和数据集),扩展了 NetworkFlow 算法(Walker et al., 2007)。
  • 它为出版物和数据集分别建模不同的衰减率,以反映其不同的过时模式。
  • 一个随机游走者在引用网络中遍历,根据引用在网络中的传播方式,为数据集分配更高的得分。
  • 该算法为每个数据集计算一个相对得分——DataRank,反映其基于引用流动的推断影响力。
  • 该方法无需显式的数据集引用;相反,它通过出版物的引用模式推断使用情况。
  • 该方法使用 GenBank 和 Figshare 的元数据进行验证,将 DataRank 得分与实际的网站访问量和下载次数进行比较。

实验结果

研究问题

  • RQ1网络流算法能否仅通过出版物引用网络有效为数据集分配信用?
  • RQ2在过时率和流动传播方面,数据集的引用动态与出版物有何不同?
  • RQ3DataRank 在多大程度上能预测真实世界的数据集使用情况,如网站访问量和下载量?
  • RQ4与基于引用的其他数据集排名方法相比,DataRank 的预测准确性如何?
  • RQ5该方法能否在不改变引用行为的前提下,支持更公平的科学影响力评估?

主要发现

  • DataRank 在预测实际数据集使用情况方面优于其他方法,其衡量标准为 GenBank 序列的网站访问量和 Figshare 数据集的下载量。
  • 该算法成功捕捉了数据集与出版物在引用动态上的差异,特别是在过时率方面。
  • 即使在引用数据有限的情况下——网络中仅找到 693 个 GenBank 记录和 355 个 Figshare 数据集——DataRank 仍实现了有意义的预测性能。
  • 该方法提供了可解释的得分,反映了数据集的相对影响力,为数据密集型科学中的影响力评估奠定了基础。
  • DataRank 无需显式引用即可对数据集进行排名,使其成为为数字科学对象分配信用的可行工具。
  • 本研究证明,即使引用实践不完整,也可通过基于网络的推断系统性地评估数据集的影响力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。