Skip to main content
QUICK REVIEW

[論文レビュー] The algebra and machine representation of statistical models

Evan Patterson|arXiv (Cornell University)|Jun 16, 2020
Statistics Education and Methodologies参考文献 179被引用数 4
ひとこと要約

本学位論文は、統計的モデルを論理的理論に類似した数学的構造として形式化するための圏論的代数的枠組みを導入し、カテゴリー理論を用いて機械による表現を可能にする。この枠組みにより、Python や R における意味的意味を保持するソフトウェアシステムを通じて、統計的推論と計算ワークフローを統合し、形式的かつ言語に依存しない科学的知識のモデリングによって、再現可能で合成可能なデータサイエンスを前進させる。

ABSTRACT

As the twin movements of open science and open source bring an ever greater share of the scientific process into the digital realm, new opportunities arise for the meta-scientific study of science itself, including of data science and statistics. Future science will likely see machines play an active role in processing, organizing, and perhaps even creating scientific knowledge. To make this possible, large engineering efforts must be undertaken to transform scientific artifacts into useful computational resources, and conceptual advances must be made in the organization of scientific theories, models, experiments, and data. This dissertation takes steps toward digitizing and systematizing two major artifacts of data science, statistical models and data analyses. Using tools from algebra, particularly categorical logic, a precise analogy is drawn between models in statistics and logic, enabling statistical models to be seen as models of theories, in the logical sense. Statistical theories, being algebraic structures, are amenable to machine representation and are equipped with morphisms that formalize the relations between different statistical methods. Turning from mathematics to engineering, a software system for creating machine representations of data analyses, in the form of Python or R programs, is designed and implemented. The representations aim to capture the semantics of data analyses, independent of the programming language and libraries in which they are implemented.

研究の動機と目的

  • . 統計的モデルの厳密な代数的基盤を圏論的論理を用いて確立すること。
  • . 統計的理論を、手法的関係を表す射を備えた代数的構造として形式化すること。
  • . Python および R におけるデータ分析の機械可読で意味を保持する表現を生成するソフトウェアシステムの設計および実装すること。
  • . 統計的手法と科学的理論の間のギャップを、科学的知識の階層をモデル化することで埋めること。
  • . 形式的で計算可能な表現を通じて、データサイエンスワークフローの機械支援推論、検証、合成を可能にすること。

提案手法

  • . 統計的理論およびその射をモデル化するために、特に色付き PROPs およびモノイダル圏を用いる。
  • . 統計的モデルを理論上の代数として定義し、パrameter化された分布族が中心的構造を形成する。
  • . プログラミング言語やライブラリに依存しない意味をエンコードする、データサイエンスワークフローの形式的オントロジーを導入する。
  • . Python および R コードから意味的意味を抽出するためのプログラム解析技術を用い、それを構造的で機械処理可能な表現に変換する。
  • . 統計的理論のための高次圏的構造を構築し、合成および積演算が厳密でないことを示唆し、将来的な高次元形式主義の研究を示唆する。
  • . 圏論に根ざした単一の形式的システム内で、実験設計、モデル構築、推論を統一的に扱う。

実験結果

リサーチクエスチョン

  • RQ1. 統計的モデルは、形式的な圏論的枠組み内で、どのように体系的に代数的構造として表現可能か?
  • RQ2. 統計的モデル間の射が、異なる統計的手法の間の関係を形式化する上で果たす役割は何か?
  • RQ3. Python および R におけるデータ分析ワークフローは、実装の詳細に依存しない機械可読で意味を保持する表現にどのように変換可能か?
  • RQ4. 統計的理論は、一般化可能性と理論の伝播を支援するために、科学的モデルの階層にどのように埋め込まれるか?
  • RQ5. 統計的モデルおよびデータ分析の形式的で計算可能な表現は、データサイエンスにおける再現性、検証性、自動化をどのように向上させるか?

主な発見

  • . 本論文は、色付き PROPs 上の代数として統計的モデルを形式化することに成功し、統計的推論の明確な圏論的枠組みを提供した。
  • . 射がモデルの簡略化やパrameter化の変更といった手法的変換を表せることを示した。
  • . Python および R のデータ分析コードを形式的で意味を保持する表現に変換する、動作するソフトウェアシステムを実装した。
  • . この枠組みにより、実験設計および実験のモデルが、統一的で形式的な知識構造の一部として表現可能となった。
  • . 現行の統計的パラダイム(帰無仮説検定を中心とする)と科学的知識の実際の構造との間に根本的な不一致が明らかになった。これにより、より包括的で階層的なモデリングアプローチの推奨がなされた。
  • . 提案されたシステムは、形式的で合成可能で検証可能なデータサイエンスワークフローを可能にすることで、機械支援科学的推論の長期的ビジョンを支援した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。