Skip to main content
QUICK REVIEW

[论文解读] Case Studies and Challenges in Reproducibility in the Computational Sciences

Sylwester Arabas, Michael Bareford|arXiv (Cornell University)|Aug 9, 2014
Scientific Computing and Data Management参考文献 35被引用 8
一句话总结

本文通过四个案例研究探讨计算科学中的可复现性挑战:涉及人类受试者实验的伦理可变性、并行计算与串行计算的可复现性对比、跨非计算机科学领域的可复现性,以及单一已发表研究在不同研究者间的可复现性。作者在利用GitHub和虚拟机(VMs)使论文本身实现开放、可执行和可复现方面取得部分成功,尽管方法论努力较强,但技术、法律和伦理障碍依然存在。

ABSTRACT

This paper investigates the reproducibility of computational science research and identifies key challenges facing the community today. It is the result of the First Summer School on Experimental Methodology in Computational Science Research (https://blogs.cs.st-andrews.ac.uk/emcsr2014/). First, we consider how to reproduce experiments that involve human subjects, and in particular how to deal with different ethics requirements at different institutions. Second, we look at whether parallel and distributed computational experiments are more or less reproducible than serial ones. Third, we consider reproducible computational experiments from fields outside computer science. Our final case study looks at whether reproducibility for one researcher is the same as for another, by having an author attempt to have others reproduce their own, reproducible, paper. This paper is open, executable and reproducible: the whole process of writing this paper is captured in the source control repository hosting both the source of the paper, supplementary codes and data; we are providing setup for several experiments on which we were working; finally, we try to describe what we have achieved during the week of the school in a way that others may reproduce (and hopefully improve) our experiments.

研究动机与目标

  • 调查计算科学跨不同领域研究中可复现性的程度及其面临的挑战。
  • 识别系统性障碍——特别是伦理、法律和技术障碍——对计算实验可复现性的阻碍。
  • 评估一位研究者实现的可复现性在多大程度上能可靠地转化为其他研究者的可复现性,特别是在人机交互研究中。
  • 展示并评估通过版本控制的源代码、代码、数据和虚拟机使研究论文本身完全可复现的可行性。
  • 通过反思暑期学校实验方法论中的真实经验,推广可复现研究的最佳实践。

提出的方法

  • 在为期一周的计算科学实验方法暑期学校期间开展四个案例研究。
  • 使用版本控制仓库(GitHub)托管论文、补充代码和数据,以实现对所有变更的可追溯性。
  • 通过虚拟机(VMs)提供可复现的计算环境,为关键实验分发了两台虚拟机。
  • 以可复现的方式执行并记录实验,允许他人重新计算结果,对自动化不可行的情况则包含手动计算步骤。
  • 应用可执行论文技术,如Sweave和动态文档生成,尽管部分表格为手动输入。
  • 通过尝试复现论文自身的科研流程,包括作者主导复现一项人机交互研究,实现元可复现性。

实验结果

研究问题

  • RQ1不同机构的伦理审批要求如何影响涉及人类受试者的计算实验的可复现性?
  • RQ2由于复杂性增加,并行和分布式计算实验是否本质上比串行实验更难复现?
  • RQ3来自非计算机科学领域(如环境科学、医学)的计算实验在多大程度上可以被复现?会遇到哪些障碍?
  • RQ4即使作者认为某项论文是可复现的,其他研究者是否能在不掌握专门背景知识的情况下成功复现?
  • RQ5在实现研究论文本身完全可复现方面,包括其自身开发过程,面临哪些实际与系统性挑战?

主要发现

  • 不同机构的伦理审批流程存在显著差异,即使方法已充分记录,这仍是人类受试者实验可复现性的主要障碍。
  • 并行和分布式实验由于非确定性、资源依赖性和复杂设置,引入了额外的可复现性挑战,但其本身并非本质上更难复现。
  • 在短时间内复现非计算机科学实验是可行的,但法律限制阻止了其中一个结果虚拟机的分发,凸显了关键障碍。
  • 尽管努力使论文完全可执行和可复现,部分计算仍需手动执行,且并非所有数据都实现了动态再分析。
  • 复现已发表的人机交互研究的尝试表明,即使记录充分,由于隐含假设、缺少上下文或未共享的环境细节,研究仍可能无法复现。
  • 论文自身的可复现性部分成功:材料可通过GitHub和虚拟机获取,但法律和技术限制阻止了所有组件的完全分发和自动化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。