Skip to main content
QUICK REVIEW

[論文レビュー] Computational reproducibility of Jupyter notebooks from biomedical publications

Sheeba Samuel, Daniel Mietchen|arXiv (Cornell University)|Sep 9, 2022
Scientific Computing and Data Management被引用数 4
ひとこと要約

本研究では、PubMed Central の 1,419 範例のバイオメディカル論文に付随する 4,169 個の Jupyter ノートブックの計算再現性を、宣言された依存関係を使って自動的に再実行することで評価した。ノートブックのうちエラーなしで実行できたのはたった 396 個にとどまり、元の結果を正確に再現できたのはたった 245 個にとどまった。これは、依存関係や環境の問題が広範にわたる再現性の課題を引き起こしていることを示しており、文書作成の改善や、査読プロセスへの再現性チェックの統合が求められる。

ABSTRACT

Jupyter notebooks allow to bundle executable code with its documentation and output in one interactive environment, and they represent a popular mechanism to document and share computational workflows, including for research publications. Here, we analyze the computational reproducibility of 9625 Jupyter notebooks from 1117 GitHub repositories associated with 1419 publications indexed in the biomedical literature repository PubMed Central. 8160 of these were written in Python, including 4169 that had their dependencies declared in standard requirement files and that we attempted to re-run automatically. For 2684 of these, all declared dependencies could be installed successfully, and we re-ran them to assess reproducibility. Of these, 396 notebooks ran through without any errors, including 245 that produced results identical to those reported in the original. Running the other notebooks resulted in exceptions. We zoom in on common problems and practices, highlight trends and discuss potential improvements to Jupyter-related workflows associated with biomedical publications.

研究の動機と目的

  • PubMed Central に共有されたバイオメディカル論文に付随する Jupyter ノートブックの計算再現性を評価すること。
  • 計算ワークフローの再現性を損なう共通の技術的および文書的問題を特定すること。
  • 依存関係の宣言、バージョニング、ノートブック構造が再現性に与える影響を評価すること。
  • 学術出版ワークフローへの再現性チェック統合の改善策を提案すること。
  • 大規模なノートブックの自動再実行の環境的影響を調査すること。

提案手法

  • PubMed Central の 1,419 範例の論文にリンクする 1,117 個の GitHub リポジトリから 9,625 個の Jupyter ノートブックを収集した。
  • 標準的な要件ファイルに依存関係が宣言された 4,169 個の Python ノートブックを、自動再実行用に選定した。
  • 隔離された環境で依存関係を自動的にインストールし、ノートブックを再実行して再現性をテストした。
  • 例外、依存関係宣言、ノートブック構造、名前付け、モジュール使用状況を分析した。
  • バージョン管理メタデータと出版日を用いて、ノートブックの実践における時間的傾向を追跡した。
  • 再実行パイプラインの計算的環境的インパクトを測定した。

実験結果

リサーチクエスチョン

  • RQ1バイオメディカル論文に付随する Jupyter ノートブックのうち、宣言された依存関係を使って正常に再実行できる割合はどれくらいか?
  • RQ2バイオメディカル Jupyter ノートブックの再実行中に発生する主な失敗要因は何か?
  • RQ3バイオメディカル研究における Jupyter ノートブックの使用とその再現性は、時間経過とともにどのように変化したか?
  • RQ4ノートブック構造、名前付け、モジュール使用状況が再現性の成功に与える相関はどの程度か?
  • RQ5大規模な自動再実行による研究用ノートブックの環境的・計算的コストはどの程度か?

主な発見

  • 再実行可能な 2,684 個のノートブックのうち、例外なしで実行できたのは 396 個にとどまり、成功率は約 14.7% であった。
  • 正常に実行されたノートブックのうち、元の論文で報告された結果と完全に同一の結果を得られたのは 245 個にとどまり、正確な結果再現の成功率は 9.1% であった。
  • 最も一般的な例外は ModuleNotFoundError、ImportError、FileNotFoundError であり、2020–2021 年に発表されたノートブックでは失敗が著しく増加した。
  • 分析対象の 80% 以上が Python で書かれており、そのうち 4,169 個にのみ標準的な要件ファイルに依存関係が宣言されていた。
  • ノートブックの名前付けや構造には整合性がなく、16% がタイトルに文字列 'test' を含んでおり、テストコードと本番コードの混同が懸念された。
  • 2,684 個のノートブックの再実行による環境的インパクトは顕著で、CO2換算で 1,200 kg の排出量が推定された。これは再現性の取り組みに伴う持続可能性コストを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。