[论文解读] Disease Trajectory Maps
该论文提出了疾病轨迹图(Disease Trajectory Map, DTM),一种概率模型,能够从电子健康记录中学习稀疏且采样不规则的临床时间序列的低维、可解释的表示。该模型采用随机变分推断方法,可扩展至大规模数据集,并在系统性硬化症数据上展示了其有效性:DTM 学习到的嵌入能够揭示具有生物学意义的亚群,并与关键临床结局显著关联,其在检测临床相关轨迹-结局关联方面优于线性混合效应模型(LMM)和函数主成分分析(FPCA)基线方法。
Medical researchers are coming to appreciate that many diseases are in fact complex, heterogeneous syndromes composed of subpopulations that express different variants of a related complication. Time series data extracted from individual electronic health records (EHR) offer an exciting new way to study subtle differences in the way these diseases progress over time. In this paper, we focus on answering two questions that can be asked using these databases of time series. First, we want to understand whether there are individuals with similar disease trajectories and whether there are a small number of degrees of freedom that account for differences in trajectories across the population. Second, we want to understand how important clinical outcomes are associated with disease trajectories. To answer these questions, we propose the Disease Trajectory Map (DTM), a novel probabilistic model that learns low-dimensional representations of sparse and irregularly sampled time series. We propose a stochastic variational inference algorithm for learning the DTM that allows the model to scale to large modern medical datasets. To demonstrate the DTM, we analyze data collected on patients with the complex autoimmune disease, scleroderma. We find that DTM learns meaningful representations of disease trajectories and that the representations are significantly associated with important clinical outcomes.
研究动机与目标
- 利用电子健康记录中的临床时间序列,识别具有相似疾病进展轨迹的潜在患者亚群。
- 确定少量潜在维度是否能够捕捉异质人群中疾病轨迹的主要变异来源。
- 研究学习到的轨迹表示与临床显著结局(如器官损伤或死亡率)之间的关联。
- 开发一种可扩展的概率模型,以处理采样不规则且稀疏的生物医学时间序列数据。
- 在揭示具有生物学意义和临床相关性的轨迹模式方面,超越现有方法(LMM、FPCA)
提出的方法
- DTM 是一种概率模型,可学习个体临床标志物轨迹的低维(2D 或 3D)潜在表示。
- 该方法将问题建模为潜在变量模型,其中每位患者的轨迹由低维嵌入和时间的灵活非线性函数生成。
- 模型采用扭曲高斯过程先验分布于随机效应,从而能够捕捉复杂且非线性的轨迹形态。
- 开发了随机变分推断算法,以实现对包含数千名患者的大型电子健康记录数据集的可扩展推断。
- 通过 10 折交叉验证进行保留对数似然估计来训练模型,以确保泛化性能。
- 使用基于核密度估计的假设检验方法,检验表示与临床结局之间的关联。
实验结果
研究问题
- RQ1在复杂的自身免疫性疾病中,是否存在具有生物学意义的、具有相似疾病进展轨迹的患者亚群?
- RQ2低维潜在空间是否能够捕捉不规则且稀疏的临床时间序列数据中的主要变异来源?
- RQ3具有特定不良临床结局(如肺动脉高压、器官损伤)的患者是否表现出显著不同的轨迹表示?
- RQ4DTM 学习到的表示与 LMM 和 FPCA 相比,在检测临床相关模式方面表现如何?
- RQ5DTM 是否能够揭示疾病轨迹形态与结局之间先前未知的关联?
主要发现
- DTM 学习到的 2D 和 3D 表示揭示了与既往临床发现一致的系统性硬化症患者不同亚群。
- DTM 在泛化性能上与 LMM 和 FPCA 相当,其在 PFVC 标记物上的保留对数似然为 -13.25 ± 1.38,在 TSS 标记物上为 -3.32 ± 0.06。
- DTM 检测到轨迹表示与肺动脉高压(PAH)之间存在统计显著关联,p 值为 0.002,而 FPCA 和 LMM 均未检测到此关联。
- 对于间质性肺病,三种模型均拒绝原假设(p < 0.001),证实了预期的关联。
- DTM 独特地揭示了 TSS 轨迹表示与溃疡/坏疽之间的显著关联(p = 0.009),而 LMM 和 FPCA 均未发现此关联。
- DTM 的表示在与皮肌炎和肺动脉高压的关联方面表现出更强的统计证据,尤其在存在与纤维化相关的危险因素时,优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。