[论文解读] A Variational Autoencoder for Heterogeneous Temporal and Longitudinal Data
本文提出了异质纵向变分自编码器(HL-VAE),一种深度生成模型,通过使用多输出加法高斯过程先验和灵活的似然函数,联合建模连续、计数、分类和有序纵向数据。该模型实现了高效、端到端的缺失值填补与未见时间点预测,在模拟数据和临床数据集上的缺失值填补与长期预测任务中均优于现有方法。
The variational autoencoder (VAE) is a popular deep latent variable model used to analyse high-dimensional datasets by learning a low-dimensional latent representation of the data. It simultaneously learns a generative model and an inference network to perform approximate posterior inference. Recently proposed extensions to VAEs that can handle temporal and longitudinal data have applications in healthcare, behavioural modelling, and predictive maintenance. However, these extensions do not account for heterogeneous data (i.e., data comprising of continuous and discrete attributes), which is common in many real-life applications. In this work, we propose the heterogeneous longitudinal VAE (HL-VAE) that extends the existing temporal and longitudinal VAEs to heterogeneous data. HL-VAE provides efficient inference for high-dimensional datasets and includes likelihood models for continuous, count, categorical, and ordinal data while accounting for missing observations. We demonstrate our model's efficacy through simulated as well as clinical datasets, and show that our proposed model achieves competitive performance in missing value imputation and predictive accuracy.
研究动机与目标
- 为解决现有变分自编码器无法在纵向设置中同时处理不同类型数据(如连续、计数、分类和有序变量)的问题。
- 开发一种能够捕捉时间点与受试者之间时间相关性的模型,同时处理完全随机缺失的数据。
- 实现对具有混合数据类型和辅助协变量(如时间、受试者特异性因素)的高维真实世界数据集的高效推理。
- 证明为不同数据类型分配适当的似然模型可显著提升在缺失值填补与预测任务中的性能。
提出的方法
- HL-VAE 使用多输出加法高斯过程先验,对跨时间和受试者的潜在变量结构化动态进行建模,捕捉潜在嵌入之间的相关性。
- 采用基于深度神经网络的解码器,并为每种数据类型设置独立的似然模型:连续型使用高斯分布,计数型使用泊松分布,离散型使用分类对数几率模型,有序分类型使用有序对数几率模型。
- 推理网络执行摊销变分推断,利用随机梯度下降近似潜在变量的后验分布。
- 通过高斯过程先验将辅助协变量(如时间、性别、疾病状态)整合到潜在空间中,支持条件生成与更优的表征学习。
- 通过在训练和推理过程中对未观测值进行边缘化处理,利用特定于似然的似然函数,支持缺失数据处理。
- 框架支持端到端反向传播训练,可在高维数据集上实现可扩展的学习。
实验结果
研究问题
- RQ1变分自编码器能否有效建模具有混合数据类型(连续、计数、分类、有序)的异质纵向数据,同时处理缺失值?
- RQ2为不同数据类型引入适当的似然模型,对纵向设置中缺失值填补与预测性能有何影响?
- RQ3与独立潜在表示相比,使用多输出加法高斯过程先验是否能更好地建模时间相关性与受试者间相关性?
- RQ4在真实世界临床数据上,HL-VAE 在缺失值填补与长期预测任务中是否显著优于现有 VAE 及基线模型?
- RQ5随着缺失数据比例和数据异质性的增加,该模型的性能表现如何变化?
主要发现
- 在 PPMI 数据集中,当缺失数据比例为 50% 时,HL-VAE 在数值预测任务中实现了 0.091 ± 0.003 的归一化均方根误差(NRMSE),优于 L-VAE,后者误差更高且在缺失率上升时性能下降更显著。
- 对于分类数据,HL-VAE 实现了 0.085 ± 0.001 的准确率误差,显著优于对比模型,证明了显式建模分类变量的优势。
- 在有序预测任务中,HL-VAE 实现了 0.085 ± 0.001 的位移误差,表现出更强的鲁棒性与更优的预测精度。
- 该模型在缺失率逐步提高的情况下仍保持稳定性能,其预测对数似然下降速度慢于 L-VAE,表明在数据稀缺条件下具备更强的泛化能力。
- 在训练过程中引入分类特征可提升数值特征的预测性能,凸显了对异质数据进行联合建模的优势。
- HL-VAE 在缺失值填补与长期预测任务中均表现出具有竞争力的性能,在模拟数据和真实世界临床数据集的所有数据类型上均取得了最佳结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。