Skip to main content
QUICK REVIEW

[论文解读] Science-Software Linkage: The Challenges of Traceability between Scientific Knowledge and Software Artifacts

Hideaki Hata, Jin Guo|arXiv (Cornell University)|Apr 13, 2021
Scientific Computing and Data Management参考文献 10被引用 12
一句话总结

本文研究了科学论文与其相关软件制品之间可追溯性的挑战,识别出链接创建、识别和维护方面的空白。通过对GitHub仓库和代码注释的实证研究,发现尽管存在链接,但它们通常是临时性的,缺乏粒度,并且容易出现链接失效,凸显了标准化、双向和持久链接机制的必要性,以提升科学与软件工程中的可重现性和知识传递。

ABSTRACT

Although computer science papers are often accompanied by software artifacts, connecting research papers to their software artifacts and vice versa is not always trivial. First of all, there is a lack of well-accepted standards for how such links should be provided. Furthermore, the provided links, if any, often become outdated: they are affected by link rot when pre-prints are removed, when repositories are migrated, or when papers and repositories evolve independently. In this paper, we summarize the state of the practice of linking research papers and associated source code, highlighting the recent efforts towards creating and maintaining such links. We also report on the results of several empirical studies focusing on the relationship between scientific papers and associated software artifacts, and we outline challenges related to traceability and opportunities for overcoming these challenges.

研究动机与目标

  • 调查科学论文与其相关软件制品之间可追溯性的现状。
  • 识别在创建、识别和维护科学知识与软件代码之间链接时面临的挑战。
  • 评估链接衰减(链接失效)对科学软件可追溯性和可重现性的影响。
  • 探讨自动化工具和元数据管理在提升链接识别与持久性方面的作用。
  • 提出一种标准化、双向和持久的链接框架,用于连接研究论文与软件制品,以增强透明度和知识传递。

提出的方法

  • 对377个在其README文件中引用学术论文的GitHub仓库进行了实证分析。
  • 使用模式匹配和人工编码对软件领域进行分类,并评估所引用论文的相关性。
  • 应用命名实体识别(NER)技术,在11,274个仓库的代码注释中识别学术论文引用。
  • 分析引用模式和代码复用情况,以检测学术引用与软件实现引用之间的差异。
  • 通过检查仓库中的版本控制和变更日志,评估论文与软件版本异步更新对版本影响。
  • 提出需要自动化可追溯性工具和元数据对比技术,以支持链接的维护与识别。

实验结果

研究问题

  • RQ1在实践中,科学论文如何与软件制品链接?主导的链接模式是什么?
  • RQ2代码注释和软件文档在多大程度上引用了学术论文?这与文献中的引用模式相比如何?
  • RQ3在不断演化的科学论文与软件仓库之间,维护可追溯性链接的主要挑战是什么?
  • RQ4链接衰减(链接失效)和版本不匹配如何影响科学-软件可追溯性的可靠性?
  • RQ5哪些机制可以提升科学知识与软件制品之间链接的精确性、双向性和持久性?

主要发现

  • 在339个在其README中引用学术论文的GitHub仓库中,92%的论文可公开访问,其中深度学习是最常见的领域。
  • 梅森尼特随机数生成器(Mersenne Twister)算法在代码注释中的引用频率高于其前身Twisted GFSR,表明向更近期和标准化实现的转变。
  • 尽管在学术文献中引用次数很高,一些有影响力的论文在代码注释中未被引用,表明科学知识向软件开发的传递存在空白。
  • 链接创建主要为临时性操作,大多数链接放置在README或代码注释中,缺乏对特定代码组件的细粒度、双向可追溯性。
  • 链接维护是主要挑战,论文或软件更新后,相关链接往往未同步更新,导致链接失效和引用断裂。
  • 自动化工具如Papers with Code和CatalyzeX改善了对相关软件的访问,但未能解决链接持久性和精确性方面的根本问题。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。