Skip to main content
QUICK REVIEW

[论文解读] Kolmogorov complexity as a hidden factor of scientific discourse: from Newton's law to data mining

Yuri I. Manin|arXiv (Cornell University)|Jan 1, 2013
Complex Systems and Time Series Analysis参考文献 3被引用 6
一句话总结

本文主张科学论述本质上分为两部分:高度压缩、柯尔莫哥洛夫复杂度低的“定律”部分(例如牛顿定律、遗传密码)和复杂度高的“数据”部分(例如初始条件、表型、观测数据库)。文章以柯尔莫哥洛夫复杂度为隐喻,解释科学理论如何将海量信息压缩为简单定律,同时指出现代数据洪流正使因果理解被虚假相关性所取代的风险——强调理论洞察力在数据挖掘之外的持久必要性。

ABSTRACT

The word "complexity" is most often used as a meta--linguistic expression referring to certain intuitive characteristics of a natural system and/or its scientific description. These characteristics may include: sheer amount of data that must be taken into account; visible "chaotic" character of these data and/or space distribution/time evolution of a system etc. This talk is centered around the precise mathematical notion of "Kolmogorov complexity", originated in the early theoretical computer science and measuring the degree to which an available information can be compressed. In the first part, I will argue that a characteristic feature of basic scientific theories, from Ptolemy's epicycles to the Standard Model of elementary particles, is their splitting into two very distinct parts: the part of relatively small Kolmogorov complexity ("laws", "basic equations", "periodic table", "natural selection, genotypes, mutations") and another part, of indefinitely large Kolmogorov complexity ("initial and boundary conditions", "phenotypes", "populations"). The data constituting this latter part are obtained by planned observations, focussed experiments, and afterwards collected in growing databases (formerly known as "books", "tables", "encyclopaedias" etc). In this discussion Kolomogorov complexity plays a role of the central metaphor. The second part and Appendix 1 are dedicated to more precise definitions and examples of complexity.

研究动机与目标

  • 将科学理论框架化为二元结构:低复杂度定律与高复杂度数据。
  • 论证柯尔莫哥洛夫复杂度作为科学压缩与解释统一隐喻的作用。
  • 通过展示数据本身无法取代因果定律,批判“理论的终结”叙事。
  • 证明即使在大数据背景下,理论压缩仍是避免虚假相关性的关键。
  • 强调科学进步依赖于通过理论洞察预先构建有意义的结构,而非仅依赖数据处理。

提出的方法

  • 使用柯尔莫哥洛夫复杂度作为科学描述中信息压缩的正式度量。
  • 分析历史科学模型(托勒密、哥白尼、牛顿、爱因斯坦)以揭示定律与数据之间的分裂。
  • 运用本轮与傅里叶级数的隐喻,说明复杂现象如何被压缩为简单定律。
  • 对比确定性定律(低柯尔莫哥洛夫复杂度)与初始/边界条件(复杂度无限高)。
  • 通过柯尔莫哥洛夫复杂度的视角审视现代数据洪流与数据挖掘(例如谷歌的方法)。
  • 以安大略省健康数据中占星符号的相关性为例,说明大规模数据集中虚假相关性的现象。

实验结果

研究问题

  • RQ1柯尔莫哥洛夫复杂度如何解释科学理论的结构性二元性——即定律与数据?
  • RQ2为何即使在大数据与数据挖掘时代,科学定律依然不可或缺?
  • RQ3信息压缩在从牛顿到标准模型的基​​本理论发展中扮演何种角色?
  • RQ4相关性能否完全取代科学中的因果定律,还是理论压缩依然必要?
  • RQ5柯尔莫哥洛夫复杂度的隐喻如何帮助区分有意义的科学模式与虚假的数据挖掘结果?

主要发现

  • 科学理论始终可划分为低柯尔莫哥洛夫复杂度部分(定律、方程)与高复杂度部分(初始条件、表型、观测数据)。
  • 牛顿万有引力定律与爱因斯坦的 E=mc² 是高度压缩的描述,蕴含巨大预测能力。
  • 三体问题与混沌系统表明,即使简单定律在初始条件敏感时也会产生高复杂度轨迹。
  • “理论的终结”这一主张——即数据相关性超越因果性——是错误的,这由大规模数据集中的虚假相关性(如占星符号与住院率)所证明。
  • 尽管数据规模已达千兆字节级别,通用图灵机的低柯尔莫哥洛夫复杂度仍表明,基础计算原理本质上是深刻理论化且高度压缩的。
  • 理论洞察依然至关重要:若无理论洞察,数据挖掘仅产生无意义的相关性,如 Austin 等人关于占星符号与健康结果的研究所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。