Skip to main content
QUICK REVIEW

[논문 리뷰] Truth, Proof, and Reproducibility: There's no counter-attack for the codeless

Charles T. Gray, Ben Marwick|arXiv (Cornell University)|2019. 07. 11.
Data Visualization and Analytics참고 문헌 26인용 수 4
한 줄 요약

이 논문은 형식적 수학적 증명이 없는 상황에서 과학적 확실성을 달성하기 위해 계산 과학 연구가 자동화된 테스트, 버전 관리, 재현 가능한 연구 컴프레헨시브와 같은 엄격하고 증명 유사한 관행을 채택해야 한다고 주장한다. 직접적인 형식적 증명이 불가능한 상황에서도 계산 작업을 수학적 증명처럼 모델링함으로써 연구자들은 재현 가능성과 신뢰성을 확보할 수 있다.

ABSTRACT

Current concerns about reproducibility in many research communities can be traced back to a high value placed on empirical reproducibility of the physical details of scientific experiments and observations. For example, the detailed descriptions by 17th century scientist Robert Boyle of his vacuum pump experiments are often held to be the ideal of reproducibility as a cornerstone of scientific practice. Victoria Stodden has claimed that the computer is an analog for Boyle's pump -- another kind of scientific instrument that needs detailed descriptions of how it generates results. In the place of Boyle's hand-written notes, we now expect code in open source programming languages to be available to enable others to reproduce and extend computational experiments. In this paper we show that there is another genealogy for reproducibility, starting at least from Euclid, in the production of proofs in mathematics. Proofs have a distinctive quality of being necessarily reproducible, and are the cornerstone of mathematical science. However, the task of the modern mathematical scientist has drifted from that of blackboard rhetorician, where the craft of proof reigned, to a scientific workflow that now more closely resembles that of an experimental scientist. So, what is proof in modern mathematics? And, if proof is unattainable in other fields, what is due scientific diligence in a computational experimental environment? How do we measure truth in the context of uncertainty? Adopting a manner of Lakatosian conversant conjecture between two mathematicians, we examine how proof informs our practice of computational statistical inquiry. We propose that a reorientation of mathematical science is necessary so that its reproducibility can be readily assessed.

연구 동기 및 목표

  • 과학 분야 전반에서 재현성 위기의 증가를 다루기 위해 계산 과학 연구의 과학적 엄격함을 재정의한다.
  • 형식적 논리적 증명이 없는 상황에서도 확실성과 재현 가능성을 확보하기 위해 계산 과학이 수학과 마찬가지로 '증명'의 형태가 필요하다고 주장한다.
  • 단위 테스트, 버전 관리, 표준화된 연구 컴프레헨시브와 같은 충분히 좋은 관행이 수학적 증명의 계산 과학적 동치로 기능할 수 있음을 제안한다.
  • 특히 계산 수학 분야에서 현대 연구 워크플로우가 증명의 블랙보드 전통에서 실험적이고 코드 기반의 탐구로 어떻게 이탈해 왔는지 분석한다.
  • 체계적이고 검증 가능하며 투명한 연구 관행을 추구하는 수학 및 계산 과학 분야의 문화적·방법론적 전환을 주장한다.

제안 방법

  • 두 수학자가 나누는 라카토시적 대화 프레임워크를 도입하여 계산 과학에서 증명과 재현 가능성의 진화를 탐구한다.
  • *Proof* 연극의 캐서린과 할을 내러티브 장치로 활용하여 전통적 수학적 증명과 현대 계산 과학 연구 관행을 대비한다.
  • CRAN 태스크 뷰에서 수집한 실제 데이터를 분석하여 R 패키지의 테스트 커버리지와 재현 가능성 관행을 평가하고, 테스트 크기 비율을 테스트 커버리지의 대체 지표로 사용한다.
  • 단위 테스트가 알고리즘의 검증 가능하고 반복 가능하며 투명한 방법으로 기능하여 수학적 증명의 계산 과학적 동치로 기능할 수 있음을 제안한다.
  • rrtools와 도메인 ID 발급 레포지토리 같은 도구의 사용을 통해 연구 컴프레헨시브를 표준화하고 보존하여 장기적인 재현 가능성을 확보한다.
  • 소프트웨어 공학 원칙—버전 관리, 스트레스 테스트, 자동 검증—을 과학 워크플로우에 통합하여 과학적 경계심을 향상시킨다.

실험 결과

연구 질문

  • RQ1형식적 논리 유도가 없는 상황에서 계산 과학 연구가 어떻게 수학적 증명 수준의 확실성을 달성할 수 있는가?
  • RQ2통계학 및 데이터 과학 분야와 같은 분야에서 현재의 계산 과학 연구 관행이 수학적 증명의 엄격함을 어느 정도 반영하고 있는가?
  • RQ3자동화된 테스트, 버전 관리, 연구 컴프레헨시브는 재현 가능성과 과학적 신뢰성 향상에 어떤 역할을 하는가?
  • RQ4왜 많은 R 패키지, 심지어 정제된 CRAN 태스크 뷰에 포함된 패키지도 단위 테스트를 포함하지 않는가? 이는 과학적 신뢰성에 어떤 함의를 갖는가?
  • RQ5계산 과학 분야의 공동체가 과학적 경계심을 확보하고 신뢰할 수 없는 연구 관행을 줄이기 위해 '충분히 좋은' 그러나 체계적인 관행을 어떻게 도입할 수 있는가?

주요 결과

  • CRAN 태스크 뷰에 나열된 4,105개의 R 패키지 중 1,524개(37%)는 단위 테스트를 포함하지 않아 재현 가능성 관행의 광범위한 격차를 보여준다.
  • 정제된 덕분에 더 안정적이고 신뢰할 수 있다고 여겨지는 태스크 뷰 패키지의 경우, 지난 10년간 테스트를 포함한 비율이 감소했다.
  • CRAN 태스크 뷰 간 테스트 커버리지에 큰 격차가 있으며, 생존 분야는 단지 23%의 패키지에 테스트가 포함된 반면 웹 기술 분야는 66%로 나타나 테스트 도입에 일관된 패턴이 없음을 시사한다.
  • 테스트 유무와 패키지 크기, 저자 수, 또는 역의존성 및 임포트 수로 측정한 중심성 간에 명확한 상관관계가 없었으며, 이는 테스트 관행의 불일관된 도입을 나타낸다.
  • 테스트 커버리지의 대체 지표로 사용된 테스트 크기 비율은 광범위하게 변동하며 시간에 따른 강한 추세가 없음을 보여주어 더 나은 메트릭스와 도구 개발의 필요성을 강조한다.
  • 저자는 형식적 증명이 계산 과학에서 실현 불가능하더라도, 자동화되고 투명한 엄격한 관행—예를 들어 단위 테스트와 버전 관리—가 과학적 확실성의 실용적이고 정당화 가능한 기준이 될 수 있다고 결론 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.