Skip to main content
QUICK REVIEW

[论文解读] M-quantile regression for multivariate longitudinal data: analysis of the Millennium Cohort Study data

Marco Alfò, Maria Francesca Marino|arXiv (Cornell University)|Dec 23, 2016
Statistical Methods and Bayesian Inference参考文献 28被引用 4
一句话总结

本文提出了一种具有个体特定随机效应的多变量M-quantile回归模型,用于分析纵向数据,考虑了个体内部相关性及多维响应之间的关联。该模型将有限混合M-quantile回归扩展至多变量结果,并通过辅助回归实现内生性校正,在千禧一代队列研究的儿童行为问题数据上展示了稳健且高效的估计效果。

ABSTRACT

We propose a M-quantile regression model for the analysis of multivariate, continuous, longitudinal data. M-quantile regression represents an appealing alternative to standard regression models, as it combines the robustness of quantile and the efficiency of expectile regression, providing a complete picture of the response variable distribution. Discrete, individual-specific, random parameters are used to account for both dependence within the same response recorded at different times and association between different responses observed on the same sample unit at a given time. A suitable parametrisation is also introduced in the linear predictor to account for possible dependence between the individual specific random parameters and the vector of observed covariates, that is to account for endogeneity of some covariates. An extended EM algorithm is proposed to derive model parameter estimates under a maximum likelihood approach. The model is applied to the analysis of the strengths and difficulties questionnaire scores from the Millennium Cohort Study in the UK.

研究动机与目标

  • 开发一种稳健且灵活的多变量纵向数据回归框架,以捕捉复杂的依赖结构。
  • 通过将Mundlak方法扩展至M-quantile回归,解决协变量中的内生性问题,确保估计的一致性。
  • 通过在不同分位数上全面刻画响应分布,超越传统的均值回归与标准分位数回归。
  • 利用离散的、个体特定的随机效应,同时建模个体内部与跨响应之间的依赖关系。
  • 将该模型应用于千禧一代队列研究中关于儿童情绪与行为问题的真实世界数据。

提出的方法

  • 使用M-quantile回归建模响应分布的位置参数,通过可调的影响力函数实现稳健且高效的推断。
  • 引入离散的、个体特定的随机效应,以在多变量纵向数据中考虑个体内部相关性与跨响应关联性。
  • 采用有限混合模型对随机效应的分布进行非参数估计,避免对分布形式的参数假设。
  • 在非正则化、非参数似然框架下,应用扩展的EM算法进行最大似然估计。
  • 通过引入辅助回归模型,使随机效应依赖于可观测协变量,从而校正内生性,遵循Mundlak与Chamberlain的方法。
  • 在线性预测器中采用参数化方法,建模随机效应与协变量之间的依赖关系,确保在存在内生性时估计的一致性。

实验结果

研究问题

  • RQ1如何在同时考虑个体内部与跨响应依赖性的前提下,将M-quantile回归扩展至多变量纵向数据?
  • RQ2观测协变量中的内生性对M-quantile回归估计有何影响,又该如何校正?
  • RQ3所提出的模型在捕捉行为结果完整分布方面,相较于标准均值回归与分位数回归有何改进?
  • RQ4社会经济与人口学因素在响应分布的不同分位数上,对内化与外化行为问题的影响程度如何?
  • RQ5在所提出的模型框架下,千禧一代队列研究数据中缺失数据为随机缺失(MAR)的假设是否合理?

主要发现

  • 该模型成功捕捉了内化与外化SDQ评分在多个分位数上的联合分布,揭示了协变量的异质性效应。
  • 男孩的外化行为得分显著更高,在第90个百分位数处系数为1.304,表明在分布上端男孩的行为问题更严重。
  • 来自社会经济地位较低地区(IMD)的儿童内化行为得分更高,在第90个百分位数处系数为-0.077,表明弱势群体的情绪问题更严重。
  • 父母教育程度对儿童外化行为得分具有负向影响,在第90个百分位数处系数为-1.427,表明教育水平越高,保护作用越强。
  • 在MAR假设下,模型表现出稳健性能,完整案例分析与全样本分析结果差异可忽略,支持推断的有效性。
  • 随机效应的标准差估计值($\sigma_{h,q}$)随分位数上升而增加,外化行为得分从q=0.50时的1.511增至q=0.90时的2.407,表明极端行为特征的异质性更大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。