Skip to main content
QUICK REVIEW

[论文解读] A Short Introduction to Kolmogorov Complexity

Volker Nannen|arXiv (Cornell University)|May 13, 2010
Computability, Logic, AI Algorithms参考文献 6被引用 6
一句话总结

本文提供了对柯尔莫哥洛夫复杂性的简明介绍,重点在于前缀复杂性作为算法随机性的一种通用且数学上一致的度量。它建立了柯尔莫哥洛夫复杂性、随机性不足、最小描述长度(MDL)以及柯尔莫哥洛夫结构函数之间的基础联系,表明MDL与最小随机性不足在对数项范围内等价。

ABSTRACT

This is a short introduction to Kolmogorov Complexity. The interested reader is referred to the text books by Cover & Thomas as well as Li & Vítanyi, which cover the fields of information theory and Kolmogorov complexity in depth and with all the necessary rigor.

研究动机与目标

  • 将柯尔莫哥洛夫复杂性作为与特定计算模型无关的算法随机性通用度量进行介绍,仅允许加法常数的差异。
  • 澄清普通复杂性与前缀柯尔莫哥洛夫复杂性之间的区别,强调前缀复杂性的数学优势。
  • 通过随机性不足的概念建立典型性标准,以评估某一字符串在给定模型下是否具有代表性。
  • 通过在对数项范围内的形式等价性,统一算法信息论中的关键概念——柯尔莫哥洛夫结构函数、最小随机性不足与最小描述长度。

提出的方法

  • 将前缀柯尔莫哥洛夫复杂性 $K(s)$ 定义为在通用图灵机(UTM)上输出字符串 $s$ 的最短自界定程序的长度。
  • 将条件柯尔莫哥洛夫复杂性 $K(s|a)$ 定义为在给定辅助输入 $a$ 的情况下输出 $s$ 的最短程序,其中 $K(s) = K(s|\epsilon)$。
  • 形式化柯尔莫哥洛夫结构函数 $h_s(\alpha) = \min_{\mathcal{S}}[\log|\mathcal{S}| : \mathcal{S} \ni s, \; K(\mathcal{S}) \leq \alpha]$,用于识别复杂度不超过 $\alpha$ 且包含 $s$ 的最小集合。
  • 将随机性不足 $\delta(s|m_p) = -\log p(s|m_p) - K(s|m_p, K(m_p))$ 定义为在模型 $m_p$ 下 $s$ 的非典型程度的度量。
  • 引入最小描述长度 $\lambda_s(\alpha) = \min_{m_p}[-\log p(s|m_p) + K(m_p) : K(m_p) \leq \alpha]$,表示使用复杂度不超过 $\alpha$ 位的模型对 $s$ 进行最短两段编码的长度。
  • 建立关键恒等式 $\beta_s(\alpha) = h_s(\alpha) + \alpha - K(s) = \lambda_s(\alpha) - K(s)$,在对数项的加法常数范围内,将最小随机性不足、结构函数与MDL联系起来。

实验结果

研究问题

  • RQ1前缀柯尔莫哥洛夫复杂性如何提供一种通用且与模型无关的算法复杂性度量?
  • RQ2柯尔莫哥洛夫结构函数、最小随机性不足与最小描述长度之间存在何种关系?
  • RQ3为何随机性不足比柯尔莫哥洛夫复杂度本身更适合作为评估字符串在模型下典型性的标准?
  • RQ4在有损压缩中,最小描述长度原则在多大程度上可用于近似最小随机性不足?
  • RQ5理论构造 $h_s(\alpha)$、$\beta_s(\alpha)$ 与 $\lambda_s(\alpha)$ 之间有何关系,其在对数项范围内的等价性有何重要意义?

主要发现

  • 柯尔莫哥洛夫结构函数 $h_s(\alpha)$ 是非递增的,且始终满足 $h_s(\alpha) + \alpha \geq K(s) - O(1)$,在最优模型选择下可取等号。
  • 对于任意字符串 $s$,长度为 $n$ 的字符串中绝大多数的柯尔莫哥洛夫复杂度接近 $n$,因为复杂度小于 $n - c$ 的字符串少于 $2^{n-c}$ 个。
  • 最小随机性不足 $\beta_s(\alpha)$ 定义为所有满足 $K(m_p) \leq \alpha$ 的模型 $m_p$ 中 $\delta(s|m_p)$ 的最小值,其量化了将压缩字符串与原始字符串区分开来的难度。
  • 最小描述长度 $\lambda_s(\alpha)$ 是使用复杂度不超过 $\alpha$ 的模型对 $s$ 进行最短两段编码的长度,且满足 $\lambda_s(\alpha) = \beta_s(\alpha) + K(s)$,在对数项范围内成立。
  • 恒等式 $\beta_s(\alpha) = h_s(\alpha) + \alpha - K(s) = \lambda_s(\alpha) - K(s)$ 在参数和取值上均成立,仅相差对数项的加法常数,从而在理论上深刻地统一了这三个概念。
  • 使描述长度最小的模型也使随机性不足最小,但反之不必然成立,这凸显了MDL在典型性与压缩语境下的最优性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。