Skip to main content
QUICK REVIEW

[論文レビュー] A Realistic Guide to Making Data Available Alongside Code to Improve Reproducibility

Nicholas Tierney, Karthik Ram|arXiv (Cornell University)|Feb 6, 2020
Scientific Computing and Data Management被引用数 6
ひとこと要約

この論文は、研究者が計算研究の再現性を高めるために、コードとともにより実用的で実行可能なデータ共有のガイダンスを提供する。理想主義的なフレームワークではなく、低コストで現実的かつ実行可能な戦略を重視している。データ共有を継続的かつ段階的なアプローチとして推奨し、バージョン管理、コンテナ化、恒久的リポジトリの活用により、再現性、透明性、再利用性の向上を実現する。

ABSTRACT

Data makes science possible. Sharing data improves visibility, and makes the research process transparent. This increases trust in the work, and allows for independent reproduction of results. However, a large proportion of data from published research is often only available to the original authors. Despite the obvious benefits of sharing data, and scientists' advocating for the importance of sharing data, most advice on sharing data discusses its broader benefits, rather than the practical considerations of sharing. This paper provides practical, actionable advice on how to actually share data alongside research. The key message is sharing data falls on a continuum, and entering it should come with minimal barriers.

研究の動機と目的

  • データ共有の推進と、研究者がそれを実装する際の実務的課題の間の継続的なギャップを是正すること。
  • 計算研究における再現性を向上させるために、コードとともにより実行可能で現実的なステップを提供すること。
  • FAIRの原則のような理想主義的原則ではなく、既存のツールとワークフローに焦点を当てることで、データ共有の障壁を低減すること。
  • 標準的な研究およびバージョン管理プロセスにデータ共有を統合することで、透明性と再利用性を促進すること。
  • コード、コンピューティング環境、データへのアクセスを保証することで、最小限の再現性を達成するのを研究者に支援すること。

提案手法

  • 最小限で低コストの行動から始める継続的データ共有のアプローチを提唱し、実行の障壁を低くすること。
  • Git などのバージョン管理システムを活用して、コードとともにデータのバージョンを追跡することで、再現性と監査可能性を確保すること。
  • 研究コンプリリアムやプロジェクト構造(例:Rパッケージ、Pythonパッケージ)を用いて、データと分析を統合し、一括での共有を可能にすること。
  • Docker や Binder などのコンテナ化ツールを活用して、データを含む完全なコンピューティング環境を封入し、一貫性のある実行を実現すること。
  • Zenodo や Dryad、GitHub などの恒久的かつ信頼性の高いリポジトリを活用して、DOI を付与したデータの公開を促進し、引用可能性と長期的アクセス性を高めること。
  • Tidy Data の原則などの標準化されたデータフォーマットとメタデータの活用を推奨し、使いやすさと相互運用性を向上させること。

実験結果

リサーチクエスチョン

  • RQ1研究者がコードとともにより実用的で低コストの戦略を用いてデータを共有するには、どのような方法があるか? 再現性の向上に寄与する。
  • RQ2バージョン管理とコンテナ化をどのように活用すれば、データとコードを再現可能な形で一緒に共有できるか?
  • RQ3計算研究におけるデータ共有の主な障壁は何であり、既存のツールとワークフローを活用することで、それらをどのように低減できるか?
  • RQ4大きな見直しや理想主義的なフレームワークを必要とせず、標準的な研究プロセスにデータ共有をどのように統合できるか?
  • RQ5恒久的リポジトリとメタデータは、データの検索可能性と再利用性をどのように向上させるか?

主な発見

  • データ共有は、コードとコンピューティング環境と併用することで、科学的研究所における再現性、透明性、信頼性を顕著に向上させる。
  • 広範なオープンデータの推進にもかかわらず、多くの研究データは出版後にアクセス不能のままであることが示され、意図と実際のギャップが顕在化している。
  • Git などのバージョン管理と、Docker や Binder などのコンテナ化の活用により、環境に依存しない一貫性のあるデータ分析の実行が可能になる。
  • Zenodo や Dryad などの恒久的リポジトリは、DOI を付与した信頼性の高いデータ保存を提供し、可視性と再利用可能性を高める。
  • RパッケージやPythonパッケージなどの研究コンプリリアムやソフトウェアパッケージにデータを統合することで、共有が簡素化され、コードとともにデータのバージョン管理が保証される。
  • 実用的なデータ共有は、FAIRの原則のような理想主義的原則を即座に満たすのではなく、段階的かつ低コストなプロセスとして実施する場合に最も効果的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。