Skip to main content
QUICK REVIEW

[论文解读] Facticity as the amount of self-descriptive information in a data set

Pieter Adriaans|arXiv (Cornell University)|Mar 10, 2012
Computability, Logic, AI Algorithms参考文献 22被引用 9
一句话总结

本文引入了事实性 φ(x) 作为使用柯尔莫哥洛夫复杂度衡量数据集中自描述信息的指标,将其定义为可客观分离于偶然内容的结构性信息量。证明了事实性是确定的:随机字符串的 φ(x) = 0,可压缩字符串满足 0 < φ(x) < ½|x| + O(1),而事实性超过阈值的字符串则缺乏最优随机模型,揭示了与熵相关的锯齿状模式,其特征与复杂系统一致。

ABSTRACT

Using the theory of Kolmogorov complexity the notion of facticity ϕ(x) of a string is defined as the amount of self-descriptive information it contains. It is proved that (under reasonable assumptions: the existence of an empty machine and the availability of a faithful index) facticity is definite, i.e. random strings have facticity 0 and for compressible strings 0 &lt; ϕ(x) &lt; 1/2 |x| + O(1). Consequently facticity measures the tension in a data set between structural and ad-hoc information objectively. For binary strings there is a so-called facticity threshold that is dependent on their entropy. Strings with facticty above this threshold have no optimal stochastic model and are essentially computational. The shape of the facticty versus entropy plot coincides with the well-known sawtooth curves observed in complex systems. The notion of factic processes is discussed. This approach overcomes problems with earlier proposals to use two-part code to define the meaningfulness or usefulness of a data set.

研究动机与目标

  • 定义一种正式且客观的信息度量方法,用于数据集中的有意义或有用信息,避免先前方法的缺陷。
  • 通过引入自描述信息的确定性、可计算度量,解决两段码模型中的“昵称问题”。
  • 确立事实性为一种确定的度量,客观区分字符串中结构性信息与随机或偶然内容。
  • 通过将事实性与熵及算法复杂度关联,为分析复杂系统、创造力和信息处理提供基础。

提出的方法

  • 通过前缀自由柯尔莫哥洛夫复杂度 K(x) 和两段码优化,将事实性 φ(x) 定义为字符串 x 中自描述信息的量。
  • 使用具有自定界编码的通用图灵机 U,以确保前缀自由性并避免索引病理问题。
  • 应用交换机引理,证明索引与数据角色可互换而无一般性损失,支持模型的对称性。
  • 引入依赖于熵的事实性阈值,超过该阈值则不存在最优随机模型。
  • 采用结构函数和 MDL 原理,平衡模型与数据编码长度,确保结构与噪声的客观分离。
  • 证明事实性是确定的:在空机器和忠实索引的假设下,它提取全部模型信息而不发生过拟合。

实验结果

研究问题

  • RQ1能否定义一种正式的信息度量,使其既客观又确定,能完全提取结构性信息而不发生过拟合?
  • RQ2事实性与二进制字符串中熵及算法复杂度的关系如何?其是否表现出复杂系统中观察到的模式?
  • RQ3两段码优化在定义稳定、客观的自描述信息度量中扮演何种角色?
  • RQ4事实性能否克服“昵称问题”及其他先前方法(如复杂度的精致性与有效复杂度)的局限性?
  • RQ5事实性是否提供一种原则性方法,用于识别数据集本质上是计算性的而非可随机建模的?

主要发现

  • 已证明事实性 φ(x) 是确定的:对于随机字符串,φ(x) = 0;对于可压缩字符串,满足 0 < φ(x) < ½|x| + O(1)。
  • 事实性超过依赖于熵的阈值的字符串不存在最优随机模型,其本质为计算性。
  • 事实性与熵的对比图呈现锯齿状模式,与统计力学和算法信息论中观察到的曲线高度相似。
  • 该理论通过依赖忠实索引假设和空机器的存在,克服了“昵称问题”,确保对病理索引函数的鲁棒性。
  • 可能存在多个事实性相同的模型,这并非缺陷,而是一种特性,反映了如格式塔转换等现象,即多种解释具有同等有效性。
  • 通用图灵机的选择仅引入常数偏差,确保不同实现间的渐近可比性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。