Skip to main content
QUICK REVIEW

[论文解读] A complete data frame work for fitting power law distributions

Colin S. Gillespie|arXiv (Cornell University)|Aug 7, 2014
Complex Systems and Time Series Analysis参考文献 16被引用 5
一句话总结

本文提出了一种统一的贝叶斯框架,通过在整个数据集中建模对幂律的偏离,来拟合重尾分布,避免了估计 $x_{\text{min}}$ 和丢弃数据的需要。该方法实现了完整的预测建模,可通过 AIC/BIC 进行模型比较,并在不同数据集间实现一致的推断,其在拟合引用数据和网络数据方面优于传统的基于 $x_{\text{min}}$ 的方法。

ABSTRACT

Over the last few decades power law distributions have been suggested as forming generative mechanisms in a variety of disparate fields, such as, astrophysics, criminology and database curation. However, fitting these heavy tailed distributions requires care, especially since the power law behaviour may only be present in the distributional tail. Current state of the art methods for fitting these models rely on estimating the cut-off parameter $x_{\min}$. This results in the majority of collected data being discarded. This paper provides an alternative, principled approached for fitting heavy tailed distributions. By directly modelling the deviation from the power law distribution, we can fit and compare a variety of competing models in a single unified framework.

研究动机与目标

  • 为解决基于 $x_{\text{min}}$ 的幂律拟合的局限性,后者会丢弃低于阈值的数据并阻碍模型比较。
  • 开发一种系统化、统一的框架,将整个经验分布建模为对重尾基线(如幂律或对数正态分布)的偏离。
  • 通过避免估计 $x_{\text{min}}$ 的步骤,使标准统计工具(如 AIC、BIC 和预测推断)得以应用。
  • 允许对具有不同 $x_{\text{min}}$ 值的模型进行直接比较,并支持在整个数据范围内进行预测。
  • 在一致的贝叶斯推断流程中整合复杂数据结构,如分箱或带有噪声的观测。

提出的方法

  • 模型定义为 $ f(x;\boldsymbol{\theta},\boldsymbol{\phi}) = \frac{g(x;\boldsymbol{\theta}) \times D(x;\boldsymbol{\phi})}{C(\boldsymbol{\theta},\boldsymbol{\phi})} $,其中 $g$ 是重尾分布(如幂律),$D$ 用于建模其偏离。
  • 偏离函数 $D(x;\boldsymbol{\phi})$ 被约束为正值,并在 $x \to \infty$ 时趋近于 1,其形式如单位指数分布的 CDF 或反逻辑函数。
  • 使用 MCMC 抽样进行贝叶斯推断,对 $\boldsymbol{\theta}$ 和 $\boldsymbol{\phi}$ 设置先验,从而实现模型参数的后验估计。
  • 通过在 $g(x;\theta)$ 和 $D(x;\boldsymbol{\phi})$ 的后验不确定性上进行积分,获得预测分布,实现全数据范围的预测。
  • 通过基于后验均值得出的 AIC 和 BIC 实现模型比较,促进在幂律与对数正态等竞争模型之间的选择。
  • 该框架通过将误差模型纳入似然函数并利用 MCMC 进行积分,自然地处理了具有测量误差或分箱的数据。

实验结果

研究问题

  • RQ1能否开发一种统一的统计框架,在不丢弃低于阈值 $x_{\text{min}}$ 的数据的情况下,拟合重尾分布?
  • RQ2当 $x_{\text{min}}$ 在不同数据集中不固定时,如何系统地进行模型比较和预测?
  • RQ3能否将对幂律的偏离建模为一种灵活且可解释的函数,以捕捉整个数据范围内的数据结构?
  • RQ4该方法在拟合现实世界数据(如引用和网络连接)方面是否优于传统的基于 $x_{\text{min}}$ 的方法?
  • RQ5在避免估计 $x_{\text{min}}$ 的框架中,AIC 和 BIC 等标准模型比较工具是否能有效应用?

主要发现

  • 所提出的框架成功地将整个数据集建模为对幂律的偏离,消除了对低于 $x_{\text{min}}$ 数据的丢弃需求。
  • 在引用数据集中,基于对数正态的模型 $M_2$ 的 BIC 为 2,917,967,低于幂律模型 $M_1$ 的 2,919,701,表明其拟合效果更优。
  • 在图片标签网络中,离散对数正态模型 $M_3$ 的 BIC 最低(167,490),优于幂律和具有指数偏离的对数正态模型。
  • 该框架实现了对历史冲突数据中总伤亡人数的一致预测,结果与弗里德曼的分析一致,并显示美国部队的伤亡率低于原住民部队。
  • 后验推断显示,$D(x;\boldsymbol{\phi})$ 对美国部队更为一致,且 $\theta^u < 0$,表明其相对于幂律的偏离程度更低。
  • 该方法通过引入误差模型,支持了测量误差和分箱数据的整合,扩展了其在具有噪声或舍入的现实数据中的适用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。