QUICK REVIEW
[论文解读] A Generic Multivariate Distribution for Counting Data
Marcos A. Capistrán, J. Andrés Christen|arXiv (Cornell University)|Mar 24, 2011
Bayesian Methods and Mixture Models参考文献 8被引用 3
一句话总结
本文提出一种通用的多元离散分布,用于计数数据,仅通过其均值向量和协方差矩阵定义,结合泊松、二项分布和负二项分布的单变量成分,并使用正态配管(normal copula)。该方法在复杂随机模型(如流行病SIR模型)中实现计算高效的贝叶斯推断,即使精确似然不可计算,该近似仍能紧密匹配各阶矩和相关性结构,即使在低计数情况下亦然。
ABSTRACT
Motivated by the need, in some Bayesian likelihood free inference problems, of imputing a multivariate counting distribution based on its vector of means and variance-covariance matrix, we define a generic multivariate discrete distribution. Based on blending the Binomial, Poisson and Negative-Binomial distributions, and using a normal multivariate copula, the required distribution is defined. This distribution tends to the Multivariate Normal for large counts and has an approximate pmf version that is quite simple to evaluate.
研究动机与目标
- 在仅已知均值向量和协方差矩阵的情况下,开发一种适用于计数数据的默认多元离散分布,类似于连续数据中的多元正态分布。
- 解决在精确似然计算不可行的随机流行病模型中进行贝叶斯无似然推断的挑战。
- 构建一种即使在低计数情况下也保持有效性和准确性的分布,此时正态近似会失效。
- 为流行病模型中的参数估计提供一种计算高效的替代方法,以替代基于模拟的ABC方法。
提出的方法
- 单变量分量为泊松、二项分布和负二项分布的混合,由均值μ和方差v参数化,记为Gd(μ, v)。
- 通过多元正态配管将变量间的依赖关系引入多元分布,边缘分布通过累积分布函数的逆变换进行转换。
- 通过在超立方体上对指定相关矩阵ρ的多元正态密度进行积分,定义精确的多元概率质量函数(pmf)。
- 通过归一化因子K和多元正态密度与标准正态密度乘积的比值,推导出近似pmf,从而实现快速计算。
- 变换s_i = Φ⁻¹(F_μ_i,v_i(x_i))将离散边缘映射为标准正态变量,同时在配管下保持相关性结构。
- 该方法确保所得分布与输入矩(均值、方差和相关性)相匹配,并在计数较大时收敛至多元正态分布。
实验结果
研究问题
- RQ1能否仅基于均值向量和协方差矩阵构建一种通用的多元离散分布,而无需完整模型规格?
- RQ2此类分布如何实现高效计算,并可用作随机流行病模型中贝叶斯推断的似然函数?
- RQ3在计数较低时,该近似在多大程度上能保持真实的相关性结构和矩匹配?
- RQ4在计算成本和准确性方面,近似pmf与精确版本相比表现如何?
主要发现
- 所提出的分布Gd_n是一种有效的多元离散分布,完全由其均值向量和协方差矩阵定义,类似于多元正态分布。
- 近似pmf gd_n计算高效,且与精确pmf高度一致,图1中的等高线图显示所有测试情形下形状几乎完全相同。
- 近似中的归一化常数K始终接近1(例如0.99或0.97),表明在实际应用中可近似视为常数。
- 由精确分布得到的相关性ρ′与目标ρ极为接近(如情况a中0.5144对比0.5),证实了依赖结构的准确性。
- 近似分布与真实分布的一阶和二阶矩完全匹配,模拟得到的矩μ_i*, v_i*, 和ρ*与输入参数高度一致。
- 在计数较大时,该分布渐近趋近于多元正态分布,如图1中情况(a)和(b)所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。