Skip to main content
QUICK REVIEW

[論文レビュー] Kolmogorov complexity as a hidden factor of scientific discourse: from Newton's law to data mining

Yuri I. Manin|arXiv (Cornell University)|Jan 1, 2013
Complex Systems and Time Series Analysis参考文献 3被引用数 6
ひとこと要約

この論文は、科学的記述が本質的に二つの部分に分けられることを主張している。一つは、ニュートンの法則や遺伝子コドンのような、極めて圧縮され、コルモゴロフ・コンプレックスィティが低い「法則」成分であり、もう一つは、初期条件や表現型、観測データベースのような高複雑性の「データ」成分である。論文は、コルモゴロフ・コンプレックスィティを、科学的理論が膨大な情報を単純な法則に圧縮する仕組みを説明する比喩として用いる。一方、現代のデータの洪水は、因果的理解を誤った相関関係に置き換えるリスクをはらんでおり、理論的洞察の持続的必要性を強調している。

ABSTRACT

The word "complexity" is most often used as a meta--linguistic expression referring to certain intuitive characteristics of a natural system and/or its scientific description. These characteristics may include: sheer amount of data that must be taken into account; visible "chaotic" character of these data and/or space distribution/time evolution of a system etc. This talk is centered around the precise mathematical notion of "Kolmogorov complexity", originated in the early theoretical computer science and measuring the degree to which an available information can be compressed. In the first part, I will argue that a characteristic feature of basic scientific theories, from Ptolemy's epicycles to the Standard Model of elementary particles, is their splitting into two very distinct parts: the part of relatively small Kolmogorov complexity ("laws", "basic equations", "periodic table", "natural selection, genotypes, mutations") and another part, of indefinitely large Kolmogorov complexity ("initial and boundary conditions", "phenotypes", "populations"). The data constituting this latter part are obtained by planned observations, focussed experiments, and afterwards collected in growing databases (formerly known as "books", "tables", "encyclopaedias" etc). In this discussion Kolomogorov complexity plays a role of the central metaphor. The second part and Appendix 1 are dedicated to more precise definitions and examples of complexity.

研究の動機と目的

  • 科学的理論を、低複雑性の法則と高複雑性のデータに二分する構造として提示すること。
  • コルモゴロフ・コンプレックスィティが、科学的圧縮と説明の統一的比喩として機能することを主張すること。
  • データそのものが因果法則を置き換えるという「理論の終焉」の主張を批判し、理論的洞察が不可欠であることを示すこと。
  • ビッグデータの文脈でも、理論的圧縮が誤った相関関係を避けるために不可欠であることを示すこと。
  • 科学的進歩は、単なるデータ処理ではなく、理論的洞察による事前的な意味のある構造の構築に依存していることを強調すること。

提案手法

  • 科学的記述における情報圧縮の形式的指標として、コルモゴロフ・コンプレックスィティを用いる。
  • プトレマイオス、コペルニクス、ニュートン、アインシュタインの歴史的科学モデルを分析し、法則とデータの二分を示す。
  • 複雑な現象がどのように単純な法則に圧縮されるかを説明するため、エピサイクルとフーリエ級数の比喩を用いる。
  • 決定論的法則(低コルモゴロフ・コンプレックスィティ)と初期・境界条件(無限に高い複雑性)を対比する。
  • ビッグデータとデータマイニング(例:グーグルのアプローチ)を、コルモゴロフ・コンプレックスィティの観点から分析する。
  • オンタリオ州の健康データにおける占星術的サインと入院率の相関関係の例を通し、大規模データセットにおける誤った相関関係を示す。

実験結果

リサーチクエスチョン

  • RQ1コルモゴロフ・コンプレックスィティは、科学的理論の構造的二重性(法則対データ)をどのように説明するか?
  • RQ2ビッグデータとデータマイニングの時代においても、なぜ科学的法則が依然として不可欠なのか?
  • RQ3ニュートンから標準模型に至るまでの基本的理論の発展において、情報圧縮はどのような役割を果たすか?
  • RQ4相関関係だけが科学において因果法則を置き換えることができるのか、それとも理論的圧縮は依然として必要なのか?
  • RQ5コルモゴロフ・コンプレックスィティの比喩は、意味のある科学的パターンと誤ったデータマイニング結果をどう区別するのを助けるか?

主な発見

  • 科学的理論は、常にコルモゴロフ・コンプレックスィティが低い部分(法則、方程式)と、高い複雑性の部分(初期条件、表現型、観測データ)に二分される。
  • ニュートンの万有引力の法則やアインシュタインの E=mc² は、膨大な予測力を内蔵した極めて圧縮された記述の例である。
  • 三体問題やカオス的系は、初期条件が感度に依存する場合、たとえ単純な法則であっても、高複雑性の軌道を生じることを示している。
  • 「理論の終焉」の主張(相関関係が因果関係を上回る)は誤りであり、大規模データセットにおける誤った相関関係(例:占星術的サインと入院率)によって裏付けられている。
  • ペタバイト規模のデータの増加にもかかわらず、ユニバーサルチューリングマシンの低コルモゴロフ・コンプレックスィティは、基礎的な計算原理が依然として深く理論的で圧縮されていることを示している。
  • 理論的洞察は依然として不可欠である。理論的洞察がなければ、データマイニングは意味のない相関関係を生み出すだけである。アーヴィンらの研究(占星術的サインと健康結果)がそれを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。