Skip to main content
QUICK REVIEW

[论文解读] Extending Growth Mixture Models Using Continuous Non-Elliptical Distributions

Yuhong Wei, Yang Tang|arXiv (Cornell University)|Mar 25, 2017
Statistical Methods and Bayesian Inference参考文献 43被引用 7
一句话总结

本文通过引入连续非椭球分布——特别是多变量偏t分布和广义双曲分布——扩展了增长混合模型(GMMs),以更好地建模具有偏态和重尾特征的纵向数据。通过利用正态方差-均值混合结构及广义逆高斯分布,对随机效应和测量误差采用这些灵活的分布,所提出的GHD-GMM与GST-GMM模型在非正态条件下显著提升了模型拟合度,并减少了虚假类别的提取,相较于高斯GMMs表现更优。

ABSTRACT

Growth mixture models (GMMs) incorporate both conventional random effects growth modeling and latent trajectory classes as in finite mixture modeling; therefore, they offer a way to handle the unobserved heterogeneity between subjects in their development. GMMs with Gaussian random effects dominate the literature. When the data are asymmetric and/or have heavier tails, more than one latent class is required to capture the observed variable distribution. Therefore, a GMM with continuous non-elliptical distributions is proposed to capture skewness and heavier tails in the data set. Specifically, multivariate skew-t distributions and generalized hyperbolic distributions are introduced to extend GMMs. When extending GMMs, four statistical models are considered with differing distributions of measurement errors and random effects. The mathematical development of GMMs with non-elliptical distributions relies on their expression as normal variance-mean mixtures and the resultant relationship with the generalized inverse Gaussian distribution. Parameter estimation is outlined within the expectation-maximization framework before the performance of our GMMs with non-elliptical distributions is illustrated on simulated and real data.

研究动机与目标

  • 解决高斯GMMs在处理具有偏态和重尾特征的非正态纵向数据时的局限性。
  • 开发基于连续非椭球分布的灵活GMM扩展,以提升模型拟合度并减少虚假类别检测。
  • 在异质性、偏态及重尾误差结构下,实现对生长轨迹和类别归属的准确估计。
  • 基于正态方差-均值混合表示,提供一种统计上严谨的参数估计框架,采用EM算法进行实现。
  • 在非正态性违反时,通过模拟与真实数据验证非椭球GMMs相较于高斯GMMs的优越性。

提出的方法

  • 通过在随机效应和测量误差中引入广义双曲分布与多变量偏t分布,将传统GMMs扩展为GHD-GMM与GST-GMM模型。
  • 利用这些分布的正态方差-均值混合表示,其中混合方差服从广义逆高斯(GIG)分布。
  • 基于正态方差-均值混合的层次结构构建似然函数,以支持基于EM算法的参数估计。
  • 实现四种模型变体:在两种不同参数化方式下(偏态位于数据空间或生长因子空间)的GHD-GMM与GST-GMM。
  • 应用EM算法估计模型参数,利用从混合表示中推导出的条件分布。
  • 使用贝克信息准则(BIC)选择最优潜类别数量,并在竞争模型间比较模型拟合度。

实验结果

研究问题

  • RQ1与高斯GMMs相比,采用非椭球分布的GMMs是否能更有效地捕捉纵向数据中的偏态与重尾特征?
  • RQ2在非正态性存在的情况下,引入偏t分布与广义双曲分布如何影响类别数的判定与模型拟合度?
  • RQ3哪种参数化方式——偏态位于数据空间还是生长因子空间——能产生更具可解释性与更高效率的模型?
  • RQ4所提出的模型在多大程度上降低了因非正态误差分布而导致虚假潜类别检测的风险?
  • RQ5当数据偏离正态性时,所提出的模型是否可作为高斯GMMs的稳健替代方案,尤其在真实世界的心理学与生物统计学应用中?

主要发现

  • 在模拟1中,随机效应非正态时,高斯GMMs高估了类别数(4类与5类的占比分别为67%与33%),而所提出的GHD-GMM与GST-GMM模型在100%的情况下正确识别出两个类别。
  • 在模拟2中,测量误差非正态时,高斯GMMs再次高估类别数(3类占比24%,4类占比57%),而所提出的模型(模型II与IV)在100%的情况下正确选择了两个类别。
  • 在两次模拟中,BIC始终更偏好所提出的GHD-GMM与GST-GMM模型(模型I与II),而非高斯GMMs或其他模型设定。
  • 在数据空间中设置偏态参数的模型(GHD-GMM在β_ηk = 0条件下)更具可解释性,而将偏态置于生长因子空间的模型(GHD-GMM在β_yk = 0条件下)参数更少,模型更简洁。
  • 广义双曲分布族包含偏t分布、方差-伽马分布与正态逆高斯分布作为特例,增强了模型对多样化数据结构的适应能力。
  • 在真实数据中,所提出的模型在拟合非正态结果(如BMI发展)方面优于高斯GMMs,通过降低因非正态性而非真实异质性导致的潜类别提取风险,提升了稳健性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。