[论文解读] Beyond the Chinese Restaurant and Pitman-Yor processes: Statistical Models with Double Power-law Behavior
本文提出了一类全新的完全随机测度——双重正则变异性CRMs——可生成具有排名频率中双幂律行为的随机概率测度。与仅表现出单一幂律区间的Pitman-Yor过程不同,所提出的模型(包括广义BFRY过程和β'过程)能够捕捉两个不同的幂律区间:低频项的幂律指数由参数τ控制,高频项的幂律指数由α控制,从而在文本和网络数据上实现显著更优的拟合效果。
Bayesian nonparametric approaches, in particular the Pitman-Yor process and the associated two-parameter Chinese Restaurant process, have been successfully used in applications where the data exhibit a power-law behavior. Examples include natural language processing, natural images or networks. There is also growing empirical evidence that some datasets exhibit a two-regime power-law behavior: one regime for small frequencies, and a second regime, with a different exponent, for high frequencies. In this paper, we introduce a class of completely random measures which are doubly regularly-varying. Contrary to the Pitman-Yor process, we show that when completely random measures in this class are normalized to obtain random probability measures and associated random partitions, such partitions exhibit a double power-law behavior. We discuss in particular three models within this class: the beta prime process (Broderick et al. (2015, 2018), a novel process called generalized BFRY process, and a mixture construction. We derive efficient Markov chain Monte Carlo algorithms to estimate the parameters of these models. Finally, we show that the proposed models provide a better fit than the Pitman-Yor process on various datasets.
研究动机与目标
- 为解决现有贝叶斯非参数模型(如Pitman-Yor过程)的局限性,后者假设仅存在单一幂律区间,尽管实证证据日益表明真实世界数据中存在双幂律行为。
- 开发一类全新的完全随机测度——双重正则变异性CRMs——可生成具有两个不同幂律区间的排名频率的随机概率测度。
- 提供此类模型的两种通用构造方法,并通过具体过程实现:广义BFRY过程和β'过程。
- 推导高效的马尔可夫链蒙特卡洛(MCMC)推断算法,用于这些模型中的参数估计。
- 通过实证验证,所提出的模型在包括文本语料和社交网络在内的多样化数据集上,相比Pitman-Yor过程具有更优的拟合效果。
提出的方法
- 提出一类新的完全随机测度(CRM),即双重正则变异性CRM,其特征为Lévy测度表现出两个不同的正则变异性区间。
- 通过稳定β过程的变换构造广义BFRY过程,通过广义伽马过程的变换构造β'过程。
- 对CRM进行归一化,得到的随机概率测度在排名频率中表现出双幂律行为:$ f_{(k)} \simeq \begin{cases} C_1 k^{-1/\tau} & \text{当 }k\text{ 较小时} \\ C_2 k^{-1/\alpha} & \text{当 }k\text{ 较大时} \end{cases} $
- 推导高效的MCMC算法,用于模型参数(包括σ、τ及其他超参数)的后验推断。
- 使用重加权的柯尔莫哥洛夫-斯米尔诺夫距离定量比较所提模型与Pitman-Yor过程的模型拟合效果。
- 将模型应用于真实数据集,包括美国国家语料库(ANC)、法语和英语书籍、NIPS1000以及一个Twitter网络,以评估其在频率分布和排名分布上的性能。
实验结果
研究问题
- RQ1能否构建一个贝叶斯非参数模型,以捕捉排名频率中的双幂律行为,并为低频和高频区间分别赋予不同的指数?
- RQ2当归一化后,所提出的双重正则变异性CRM是否能产生具有两个不同幂律区间的随机划分和频率分布?
- RQ3广义BFRY过程和β'过程在拟合具有疑似双幂律行为的真实世界数据集方面,与Pitman-Yor过程相比表现如何?
- RQ4能否为这些新模型开发高效的MCMC推断方法,以实现在大规模数据集上的实际应用?
- RQ5在实证数据中观察到的双幂律行为(如词频和网络度数)是否能被所提模型更准确地捕捉,而优于基于标准Pitman-Yor过程的模型?
主要发现
- 广义BFRY过程和β'过程作为双重正则变异性CRM的实例,成功建模了排名频率中的双幂律行为,其低频区间的指数τ和高频区间的指数α具有明确区分。
- 在美国国家语料库(ANC)数据集上,GBFRY模型的柯尔莫哥洛夫-斯米尔诺夫距离为0.033,显著低于Pitman-Yor过程的0.081,表明其拟合效果更优。
- 在NIPS1000数据集上,GBFRY模型的偏差为0.041,优于Pitman-Yor过程(0.059)和广义伽马过程(0.08),证实其具有更优的预测性能。
- 高频指数τ的后验可信区间在文本数据集中始终接近1(例如,ANC数据集为(0.998, 1.055)),支持齐普夫指数假设。
- GBFRY模型成功捕捉了Twitter数据中的双幂律行为,高频指数τ ≈ 1.60,低频指数σ ≈ 0.28,而Pitman-Yor过程无法有效建模高频尾部。
- 视觉后验预测检验(图3)表明,仅GBFRY和β'模型能准确捕捉比例出现次数和排名频率中的双幂律形态,而Pitman-Yor模型则不能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。