Skip to main content
QUICK REVIEW

[论文解读] Numerical Evaluation of Algorithmic Complexity for Short Strings: A Glance into the Innermost Structure of Randomness

Jean-Paul Delahaye, Héctor Zenil|Jan 25, 2011
Computability, Logic, AI Algorithms被引用 4
一句话总结

本文提出一种新颖的数值方法,通过穷举模拟已知停机时间的全部2符号、4状态确定性图灵机(基于Busy Beaver问题),以估算长度不超过16位的短比特串的算法复杂度。基于所得输出频率分布,应用Levin-Zvonkin-Chaitin编码定理推导出算法概率,从而估算Kolmogorov-Chaitin复杂度,提供一种稳健的、无常数项的替代方法,相较于基于压缩的估计器具有跨机器规模的强经验一致性。

ABSTRACT

We describe an alternative method (to compression) that combines several theoretical and experimental results to numerically approximate the algorithmic (Kolmogorov-Chaitin) complexity of all $\sum_{n=1}^82^n$ bit strings up to 8 bits long, and for some between 9 and 16 bits long. This is done by an exhaustive execution of all deterministic 2-symbol Turing machines with up to 4 states for which the halting times are known thanks to the Busy Beaver problem, that is 11019960576 machines. An output frequency distribution is then computed, from which the algorithmic probability is calculated and the algorithmic complexity evaluated by way of the (Levin-Zvonkin-Chaitin) coding theorem.

研究动机与目标

  • 解决在压缩方法因加法常数开销而失效的短字符串上估算算法复杂度的挑战。
  • 开发一种直接的、基于经验的方法来近似算法复杂度,而不依赖有损压缩启发式方法。
  • 通过分析小型图灵机的输出频率分布,探索随机性的内在结构。
  • 使用斯皮尔曼等级相关系数,验证在不断增加的机器状态空间中算法复杂度排序的稳定性与一致性。

提出的方法

  • 穷举模拟来自Busy Beaver问题的全部11,019,960,576个具有已知停机时间的2符号、4状态确定性图灵机。
  • 记录所有停机输出,以构建长度不超过16位的比特串的经验频率分布D。
  • 应用Levin-Zvonkin-Chaitin编码定理,从输出频率推导出算法概率m(s),使用关系式C(s) ≈ -log₂m(s)。
  • 利用所得分布计算所有长度≤8位的字符串及部分长度达16位的字符串的算法复杂度值。
  • 使用斯皮尔曼等级相关系数,验证在不同机器状态空间(n=1至4)中字符串排序的一致性。
  • 考虑估计复杂度值的固有非整数性质,将其解释为相对算法简洁性的细粒度度量。

实验结果

研究问题

  • RQ1在压缩方法因加法常数而失效的短字符串上,能否可靠估算算法复杂度?
  • RQ2当将模拟的图灵机空间从3状态扩展到4状态时,算法复杂度排序的稳定性如何?
  • RQ3小型图灵机输出频率分布在多大程度上反映了字符串的真实算法概率?
  • RQ4编码定理方法是否能产生一致且有意义的复杂度值,从而在不断增加的机器复杂度下保持字符串间的相对顺序?
  • RQ5计算模型的选择(例如,2符号、4状态图灵机)如何影响最终的复杂度分类?

主要发现

  • 该方法成功计算出全部256个8位字符串及部分长度达16位的字符串的算法复杂度估计值,提供了一个全面的数值数据集。
  • 从模拟的4状态图灵机中获得的输出频率分布,保留了来自更小机器空间(n=1至4)的字符串相对排序,斯皮尔曼相关系数较高,表明具有强一致性。
  • 在D(3)与D(4)之间字符串排序的首次偏差仅出现在第20位,表明前20个最频繁的字符串在不同机器规模下保持其相对顺序。
  • 估计的算法复杂度值为非整数,反映出一种细粒度结构,使得字符串之间的相对比较更加精确。
  • 该方法减少了对通用图灵机或压缩算法的任意选择的依赖,提供了一种自下而上的、基于实证的替代传统估计器的方法。
  • 结果表明,从小型通用图灵机导出的算法概率为测量算法复杂度提供了一种自然的、无常数项的分布。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。