[论文解读] Zipf's law and L. Levin's probability distributions
本文提出,Zipf定律——语言中观察到的幂律频率分布——在与Kolmogorov复杂度结合时,自然源自L. Levin的先验概率分布。通过证明词的排序与指数复杂度相关,并且Levin的分布将概率分配为前缀Kolmogorov复杂度的倒数,作者推导出Zipf定律的指数为-1,这是算法信息论基本原理的必然结果。
Zipf's law in its basic incarnation is an empirical probability distribution governing the frequency of usage of words in a language. As Terence Tao recently remarked, it still lacks a convincing and satisfactory mathematical explanation. In this paper I suggest that at least in certain situations, Zipf's law can be explained as a special case of the a priori distribution introduced and studied by L. Levin. The Zipf ranking corresponding to diminishing probability appears then as the ordering determined by the growing Kolmogorov complexity. One argument justifying this assertion is the appeal to a recent interpretation by Yu. Manin and M. Marcolli of asymptotic bounds for error--correcting codes in terms of phase transition. In the respective partition function, Kolmogorov complexity of a code plays the role of its energy. This version contains minor corrections and additions.
研究动机与目标
- 为Zipf定律提供一个数学解释,尽管其在经验上普遍存在,但目前尚缺乏令人完全满意的理论基础。
- 通过将词频与Kolmogorov复杂度联系起来,将Zipf定律与算法信息论联系起来。
- 表明Zipf定律中的逆频率排序对应于Kolmogorov复杂度的递增,最多相差一个乘法常数。
- 论证L. Levin的先验概率分布,当应用于结构化、生成性系统时,自然产生Zipf频率分布。
- 通过将‘努力最小化’原则重新解释为描述对象的最短程序长度,即$K(w)$,从而将该原则与算法复杂度统一起来。
提出的方法
- 使用一组操作(γ, σ, ρ, μ, ι)和结构化编号,构建一个可计算函数的构造性世界。
- 使用Kolmogorov复杂度$K(w)$作为算法信息内容的度量,其中$K(w)$通过最优编码定义,最多相差$\exp(O(1))$因子。
- 应用L. Levin的先验概率分布,该分布为概率分配$\sim KP(w)^{-1}$,其中$KP(w)$为指数前缀复杂度。
- 建立按频率递减排序的对象(Zipf定律)与$K(w)$递增之间的对应关系,最多相差$\exp(O(1))$因子。
- 利用$K(w)$与$KP(w)$之间的渐近等价性,其中$K(w) \preceq KP(w) \preceq K(w) \cdot \log^{1+\varepsilon} K(w)$,以证明幂律行为的合理性。
- 借鉴纠错码和编码理论中相变的类比,其中Kolmogorov复杂度在配分函数中扮演能量的角色。
实验结果
研究问题
- RQ1能否从算法复杂度而非启发式成本模型推导出Zipf定律?
- RQ2Kolmogorov复杂度在决定语言项目频率排序中的作用是什么?
- RQ3L. Levin的先验概率分布与词频中观察到的幂律行为有何关系?
- RQ4为何Zipf定律中的指数稳定在-1?这是否由基于复杂度的先验解释?
- RQ5‘观测’系统与‘生成’系统之间的区别在多大程度上影响Zipf分布的出现?
主要发现
- 指数为-1的Zipf定律作为按Kolmogorov复杂度递增排序的结果而出现,最多相差$\exp(O(1))$因子。
- L. Levin的先验分布分配概率$\sim KP(w)^{-1}$,其中$KP(w)$为指数前缀复杂度,这导致幂律频率分布。
- K(w)与KP(w)之间的微小差异——受$\log^{1+\varepsilon} K(w)$限制——解释了为何完整无穷级数$\sum K(m)^{-1}$发散,但有限近似值仍能产生Zipf行为。
- 该模型将Zipf原始最小化原则中的‘努力’重新解释为描述对象的最短程序长度,即$K(w)$。
- 该框架不仅适用于语言,也适用于生成系统(如纠错码),其中复杂度在类似热力学的配分函数中扮演能量角色。
- 该方法将Zipf定律与算法信息论统一起来,提供了比启发式成本模型或随机假设更深层次的解释。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。