Skip to main content
QUICK REVIEW

[論文レビュー] Reproducibility as a Technical Specification

Tom Crick, Benjamin A. Hall|arXiv (Cornell University)|Apr 6, 2015
Scientific Computing and Data Management参考文献 53被引用数 3
ひとこと要約

本論文は、標準化されたサイバインfraストラクチャとワークフローを用いて、計算科学研究の研究成果物の自動的検証・検証を可能にする再現性サービスの形式的技術的規定を提案する。研究成果物の評価を出版プロセスに統合し、段階的なレビュー制度とコミュニティがキュレートするリポジトリを用いることで、計算科学における再現性に測定可能で強制可能な基準を確立する。事例研究として、BioModelAnalyzerツールを用いる。

ABSTRACT

Reproducibility of computationally-derived scientific discoveries should be a certainty. As the product of several person-years' worth of effort, results -- whether disseminated through academic journals, conferences or exploited through commercial ventures -- should at some level be expected to be repeatable by other researchers. While this stance may appear to be obvious and trivial, a variety of factors often stand in the way of making it commonplace. Whilst there has been detailed cross-disciplinary discussions of the various social, cultural and ideological drivers and (potential) solutions, one factor which has had less focus is the concept of reproducibility as a technical challenge. Specifically, that the definition of an unambiguous and measurable standard of reproducibility would offer a significant benefit to the wider computational science community. In this paper, we propose a high-level technical specification for a service for reproducibility, presenting cyberinfrastructure and associated workflow for a service which would enable such a specification to be verified and validated. In addition to addressing a pressing need for the scientific community, we further speculate on the potential contribution to the wider software development community of services which automate de novo compilation and testing of code from source. We illustrate our proposed specification and workflow by using the BioModelAnalyzer tool as a running example.

研究の動機と目的

  • 再現性の継続的危機に応えるために、再現性を文化的・社会的問題としてではなく、技術的規定として位置づけること。
  • 研究ソフトウェア成果物を評価するための標準化され、測定可能で検証可能なサービスを設計し、ソースから自動的にコンパイルおよびテストを可能にすること。
  • 成果物評価を学術出版プロセスに統合し、当初は任意として導入し、時間の経過とともに義務化していくこと。
  • 初期段階の研究者やリソースが限られたグループの負担を軽減するため、インfraストラクチャおよびライセンスのオーバーヘッドを最小限に抑えること。
  • 評価済み成果物のコミュニティキュレート型リポジトリを構築し、再現可能研究におけるベストプラクティスと模範例を促進すること。

提案手法

  • 自動的に新規にコンパイルおよびテスト可能なソースコードの再現性サービスの高水準技術的規定を設計すること。
  • 多様な計算環境で成果物を検証できるように、標準化されたツールチェーンとワークフローを備えたサイバインfraストラクチャスタックを定義すること。
  • 交通標識システム(例:合格、警告、不合格)を用いた段階的成果物評価プロセスを実装し、再現性の水準を評価すること。
  • 段階的導入モデルを導入:年 t で任意、年 t+1 でレビューへの影響なしに義務化、年 t+2 でレビューへの影響ありに義務化。
  • 実際の仕組みを説明するための走りの例として、BioModelAnalyzerツールを用いること。
  • 評価済み成果物の成長し、検索可能なデータベースを維持するコミュニティ主導のキュレートシステムを構築すること。

実験結果

リサーチクエスチョン

  • RQ1計算科学における再現性を文化的理想ではなく、測定可能で技術的な規定として形式化するにはどうすればよいか?
  • RQ2研究ソフトウェア成果物の自動的・繰り返し可能な検証を可能にするために、必要なサイバインfraストラクチャとワークフローの構成要素は何か?
  • RQ3研究者に不必要な負担をかけずに、成果物評価を学術出版プロセスに統合するにはどうすればよいか?
  • RQ4広範なコミュニティの受容を促進しながら、混乱を最小限に抑えるための段階的導入戦略は何か?
  • RQ5標準化され、コミュニティがキュレートする評価済み成果物のリポジトリは、ベストプラクティスの促進と研究品質の向上にどのように寄与するか?

主な発見

  • 提案された技術的規定により、標準化されたコンパイルおよびテストワークフローを通じて、計算科学研究成果物の自動的・繰り返し可能な検証が可能になる。
  • 段階的導入モデル(当初は任意、次にレビューへの影響なしに義務化、最後にレビューへの影響ありに義務化)により、文化的な変化を最小限の混乱で促進できる。
  • 成果物評価の交通標識システムは、レビューアーや読者に再現性の水準を明確に、視覚的かつスケーラブルに伝えるための方法を提供する。
  • 評価済み成果物のコミュニティキュレートは、ベンチマークや比較、ベストプラクティス共有を支援する、成長し、再利用可能な知識基盤を創出する。
  • 一貫性があり、透明で均一な評価基準を保証することで、再現性を「武器化」するリスクを低減できる。
  • BioModelAnalyzerを用いた事例研究により、この規定を実世界の科学的ソフトウェアに適用する可能性と実用性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。