[论文解读] LMLFM: Longitudinal Multi-Level Factorization Machine
LMLFM 是一种新颖的纵向多层级因子分解机,能够在具有复杂相关结构(纵向相关和聚类相关)的高维纵向数据中联合选择固定效应和随机效应。它采用具有两层拉普拉斯先验的分层贝叶斯框架,并结合迭代条件模态优化,相较于现有最先进方法,在包含超过 5,000 个变量的模拟数据和真实世界数据上,实现了更优的预测精度、稀疏性与可扩展性。
We consider the problem of learning predictive models from longitudinal data, consisting of irregularly repeated, sparse observations from a set of individuals over time. Such data often exhibit {\em longitudinal correlation} (LC) (correlations among observations for each individual over time), {\em cluster correlation} (CC) (correlations among individuals that have similar characteristics), or both. These correlations are often accounted for using {\em mixed effects models} that include {\em fixed effects} and {\em random effects}, where the fixed effects capture the regression parameters that are shared by all individuals, whereas random effects capture those parameters that vary across individuals. However, the current state-of-the-art methods are unable to select the most predictive fixed effects and random effects from a large number of variables, while accounting for complex correlation structure in the data and non-linear interactions among the variables. We propose Longitudinal Multi-Level Factorization Machine (LMLFM), to the best of our knowledge, the first model to address these challenges in learning predictive models from longitudinal data. We establish the convergence properties, and analyze the computational complexity, of LMLFM. We present results of experiments with both simulated and real-world longitudinal data which show that LMLFM outperforms the state-of-the-art methods in terms of predictive accuracy, variable selection ability, and scalability to data with large number of variables. The code and supplemental material is available at \url{https://github.com/junjieliang672/LMLFM}.
研究动机与目标
- 为解决从高维纵向数据中学习预测模型的挑战,其中固定效应与随机效应在先验上未被指定。
- 在考虑复杂相关结构(包括纵向相关(LC)和聚类相关(CC))的同时,联合选择固定效应与随机效应。
- 减少对超参数调优的依赖,并提升在变量数量庞大的数据中的可扩展性。
- 在纵向场景中实现对非线性交互作用的有效建模,以及稀疏、可解释的表示。
- 提供一种可证明收敛、计算高效的替代方案,以应对现有混合效应模型在变量数量增加时扩展性差的问题。
提出的方法
- LMLFM 通过使用具有两层拉普拉斯先验的分层贝叶斯公式,将因子分解机(FM)扩展至纵向数据。
- 第一层拉普拉斯先验在潜在因子表示中引入稀疏性,从而实现对高维数据的高效学习。
- 第二层拉普拉斯先验用于区分固定效应(在个体间共享)与随机效应(随个体或聚类变化),实现自动效应选择。
- 模型通过迭代条件模态(ICM)算法进行训练,该算法确保了强收敛性保证与计算效率。
- LMLFM 通过在统一的概率框架中整合个体层面与群体层面效应,联合建模非线性交互作用与相关结构(LC 与 CC)。
- 该框架实现了无需大量超参数调优的自动变量选择,从而增强了模型的可解释性与可扩展性。
实验结果
研究问题
- RQ1是否能够构建一个统一模型,在考虑复杂相关结构的前提下,联合选择高维纵向数据中的固定效应与随机效应?
- RQ2在模拟与真实世界纵向数据上,LMLFM 相较于最先进基线方法,在预测精度与变量选择方面表现如何?
- RQ3LMLFM 在变量数超过 5,000 的数据集中,其可扩展性如何?传统混合效应模型在此类数据中已失效。
- RQ4LMLFM 是否能有效识别真实数据中纵向相关(LC)与聚类相关(CC)的存在及其主导性?
- RQ5LMLFM 是否能生成稀疏、可解释的模型,并与健康与社会科学数据中的领域特定发现一致?
主要发现
- LMLFM 能够成功建模变量数超过 5,000 的纵向数据,而传统混合效应模型在变量数超过 100 时即失效。
- 在包含 1,553 个变量的 GSS 数据集上,LMLFM 在所有基线方法中取得了最高的 R² 分数,显著优于 FM、MLLASSO 和 RF 的预测精度。
- LMLFM 从 1,199 个变量中识别出 126 个非零固定效应,仅有 6 个特征的绝对效应值 > 0.1,表明具有高度稀疏性与有效的变量选择能力。
- 在 GSS 数据上,随机效应矩阵 Θ^O 的稀疏率为 84.9%,表明聚类相关(CC)显著主导于纵向相关(LC)。
- LMLFM 识别出的变量与既往关于幸福感预测因子的研究发现一致,包括婚姻状况、健康、财务满意度与宗教性。
- LMLFM 在 GSS 数据中排除了纵向相关(LC)的存在,可能由于调查观测间隔过长;同时确认了聚类相关(CC)的主导地位。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。