[论文解读] A latent variable model with mixed binary and continuous response variables
本文提出了一种潜在变量模型,通过使用Probit链接和多元正态潜在变量,联合估计连续型、二值型和右删失型结果,利用单纯形概率计算实现高效的最大似然估计。该方法在小样本中优于有限信息估计器,并已实现于R包 lava.tobit 中,为复杂结构方程模型提供了一种可扩展的替代方法,相较于基于求积的方法更具效率。
We propose a method for obtaining maximum likelihood estimates in a model with continuous and binary outcomes. Combinations of left and right censored observations are also naturally modeled in this framework. The model and estimation procedure has been implemented in the R package lava.tobit. The method is demonstrated on brain imaging and personality data where measurement error on predictor variables is handled in a latent variable framework. A simulation study is conducted comparing the small sample properties of the MLE with a limited information estimator.
研究动机与目标
- 开发一种用于包含连续型、二值型和右删失型结果的结构方程模型的最大似然估计框架。
- 解决现有方法(如AGQ和MCEM)在高维潜在变量设置下计算成本高或收敛性差的局限性。
- 在潜在变量框架下实现条件(个体特定)效应和方差成分的估计,并校正测量误差。
- 通过利用多元正态单纯形概率,为自适应高斯求积和蒙特卡洛EM方法提供一种计算高效的替代方案。
- 通过神经影像学和人格数据的应用,展示该方法在建模生物标志物与心理特质之间复杂关系方面的实用性。
提出的方法
- 该模型采用潜在变量框架,其中二值型结果通过潜在正态分布变量上的阈值机制生成。
- 连续型结果直接作为潜在变量建模,而右删失型结果则通过截断潜在变量分布来处理。
- 似然函数源自多元正态单纯形概率,避免了对随机效应进行数值积分。
- 通过单纯形概率的导数,解析计算得分函数和观测信息矩阵,从而实现快速且精确的最大似然估计。
- 通过协变量与随机效应之间的交互项支持随机斜率,允许个体间效应异质性。
- 该方法已实现于开源R包 lava.tobit 中,支持完整模型设定,包括通过参数函数实现的非线性协变量效应。
实验结果
研究问题
- RQ1如何在一个统一的潜在变量模型中高效处理单一估计框架下的混合连续型、二值型和右删失型结果?
- RQ2与有限信息估计器相比,该模型在小样本中的最大似然估计具有怎样的性质?
- RQ3在高维潜在变量模型中,能否使用多元正态分布的单纯形概率替代计算密集型的数值积分?
- RQ4在预测变量存在测量误差的情况下,该方法在估计条件效应和方差成分方面表现如何?
- RQ5在非正态结果的复杂结构方程模型中,该模型在支持因果推断方面的能力有多大?
主要发现
- 所提出的最大似然估计器在小样本中表现优于有限信息估计器,尤其在偏差和置信区间覆盖概率方面表现更优。
- 5-HT2A受体结合潜力对潜在人格特质“依赖性”的标准化回归系数为0.791(p值为0.04),表明存在强烈关联。
- 与平均值相比,5-HT2A受体结合水平高出两个标准差的个体,其对人格问卷项目的阳性反应概率增加了20%(95%置信区间:[1.05, 1.34])。
- 该模型成功处理了预测变量中的测量误差,并允许在给定潜在特质水平下对项目反应的条件概率进行估计。
- 该算法在模型复杂度增加时仍能高效扩展,避免了AGQ和MCEM方法固有的维度灾难问题。
- 当在测量模型中包含所有项目时,出现数值不稳定性,需移除一个项目(第131题)以确保收敛。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。