[論文レビュー] Truth, Proof, and Reproducibility: There's no counter-attack for the codeless
この論文は、形式的論理的証明が不可能な状況下でも、科学的確実性を達成するため、計算科学的研究が自動テスト、バージョン管理、再現可能性のある研究コンプリリアン(compendia)といった、証明に類似したきめ細やかな実践を採用する必要があると主張している。形式的証明が不可能な状況下でも、計算的作業を数学的証明に類似させることで、再現可能性と信頼性を確保できる。
Current concerns about reproducibility in many research communities can be traced back to a high value placed on empirical reproducibility of the physical details of scientific experiments and observations. For example, the detailed descriptions by 17th century scientist Robert Boyle of his vacuum pump experiments are often held to be the ideal of reproducibility as a cornerstone of scientific practice. Victoria Stodden has claimed that the computer is an analog for Boyle's pump -- another kind of scientific instrument that needs detailed descriptions of how it generates results. In the place of Boyle's hand-written notes, we now expect code in open source programming languages to be available to enable others to reproduce and extend computational experiments. In this paper we show that there is another genealogy for reproducibility, starting at least from Euclid, in the production of proofs in mathematics. Proofs have a distinctive quality of being necessarily reproducible, and are the cornerstone of mathematical science. However, the task of the modern mathematical scientist has drifted from that of blackboard rhetorician, where the craft of proof reigned, to a scientific workflow that now more closely resembles that of an experimental scientist. So, what is proof in modern mathematics? And, if proof is unattainable in other fields, what is due scientific diligence in a computational experimental environment? How do we measure truth in the context of uncertainty? Adopting a manner of Lakatosian conversant conjecture between two mathematicians, we examine how proof informs our practice of computational statistical inquiry. We propose that a reorientation of mathematical science is necessary so that its reproducibility can be readily assessed.
研究の動機と目的
- 科学的分野全体に広がる再現性の危機に対処するため、計算科学研究における科学的厳密性を再定義すること。
- 形式的論理的証明が存在しないにもかかわらず、計算科学が数学と同様に「証明」に類するものが必要であり、それが確実性と再現可能性を保証することを主張すること。
- 単体テスト、バージョン管理、標準化された研究コンプリリアンといった「十分よい」実践が、計算科学における数学的証明の同等物として機能できることを提唱すること。
- 特に計算数学分野における現代の研究ワークフローが、証明の黒板的伝統から、実験的・コードベースの探求へとどのようにずれていったかを検討すること。
- 数学的・計算科学分野における文化的・メソドロジカルな転換を提唱し、体系的で検証可能かつ透明性のある研究実践へと移行すること。
提案手法
- 2人の数学者間のラカトシアン的対話フレームワークを採用し、計算科学における証明と再現性の進化を探求する。
- 『プローフ』(Proof)という演劇に登場するキャサリンとハルを物語的装置として用い、伝統的な数学的証明と現代の計算科学研究実践を対比する。
- CRANタスクビューからの実世界データを分析し、Rパッケージにおけるテストカバレッジと再現性実践を評価する。テストサイズ比をテストカバレッジの代理指標として用いる。
- 単体テストが、アルゴリズムの検証を検証可能で繰り返し可能かつ透明に可能にする計算的アナログとして機能することを提唱する。
- rrtools や DOI 発行リポジトリの使用を提唱し、研究コンプリリアンの標準化と保存を図り、長期的な再現可能性を確保する。
- ソフトウェア工学の原則(バージョン管理、ストレステスト、自動検証など)を科学的ワークフローに統合し、科学的勤勉性を高めること。
実験結果
リサーチクエスチョン
- RQ1形式的論理的導出が存在しない状況下で、計算科学研究がどのように数学的証明と同等の確実性を達成できるか。
- RQ2統計学やデータサイエンスなどの分野における現在の計算科学研究実践が、数学的証明の厳密性をどの程度反映しているか。
- RQ3自動テスト、バージョン管理、研究コンプリリアンが再現性と科学的信頼性をどのように高めているか。
- RQ4なぜ多くのRパッケージ、特にキュレートされたCRANタスクビューに属するパッケージでさえ単体テストが欠落しているのか。これは科学的信頼性にどのような含意をもたらすか。
- RQ5計算科学のコミュニティが、科学的勤勉性を確保し、疑わしい研究実践を減らすために、「十分よいが体系的」な実践をどのように採用できるか。
主な発見
- CRANタスクビューにリストアップされた4,105個のRパッケージのうち、1,524個(37%)が単体テストを含まず、再現性実践における広範なギャップを示している。
- キュレートされたパッケージであるにもかかわらず、10年前と比較してテストを含むパッケージの割合は減少傾向にあり、安定性や信頼性が高そうだとされるにもかかわらず、依然として再現性の欠落が顕著である。
- CRANタスクビュー間でテストカバレッジに顕著な差が見られ、生存分析(Survival)では23%のパッケージにテストが含まれる一方、ウェブ技術(Web Technologies)では66%にまで達しており、テスト導入に一貫性がないことが示唆される。
- テストの有無とパッケージのサイズ、著者数、中心性(逆依存関係およびインポート数で測定)との間に明確な相関関係は認められず、テスト実践の導入が一貫していないことが判明した。
- テストサイズ比をテストカバレッジの代理指標として用いた分析では、広範な変動が認められ、時間経過による明確なトレンドはなく、より良いメトリクスとツールの必要性が浮き彫りになった。
- 著者らは、形式的証明が計算科学では達成不可能であるとしても、自動的かつ透明性のあるきめ細やかな実践(単体テスト、バージョン管理など)が、科学的確実性の実用的で防衛可能な基準として機能できることを結論づけた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。