[论文解读] Bayesian Double Feature Allocation for Phenotyping with Electronic Health Records
本文提出了一种贝叶斯双特征分配(DFA)模型,用于电子健康记录(EHR)中的无监督表型分析,通过印度餐厅过程的创新扩展,同时将患者和症状分配给潜在疾病。该方法整合了已知诊断和症状-疾病关联的先验知识,实现了可解释的、具有不确定性感知的潜在疾病推断——在中文EHR数据上的应用成功识别出10种生物学上合理的潜在疾病,包括脂质代谢障碍、贫血和感染等。
We propose a categorical matrix factorization method to infer latent diseases from electronic health records (EHR) data in an unsupervised manner. A latent disease is defined as an unknown biological aberration that causes a set of common symptoms for a group of patients. The proposed approach is based on a novel double feature allocation model which simultaneously allocates features to the rows and the columns of a categorical matrix. Using a Bayesian approach, available prior information on known diseases greatly improves identifiability and interpretability of latent diseases. This includes known diagnoses for patients and known association of diseases with symptoms. We validate the proposed approach by simulation studies including mis-specified models and comparison with sparse latent factor models. In the application to Chinese EHR data, we find interesting results, some of which agree with related clinical and medical knowledge.
研究动机与目标
- 开发一种无监督方法,用于从EHR数据中识别未明确记录但通过共享症状模式表现的潜在疾病。
- 通过允许患者、症状与潜在疾病之间存在重叠的多对多关系,克服传统聚类和矩阵分解方法的局限性。
- 在贝叶斯框架中整合先验知识(如已知诊断和症状-疾病关联),以改善潜在疾病结构的可识别性与可解释性。
- 通过估计个体疾病概率,实现患者层面的推断,支持临床优先级排序与决策制定。
- 通过后验概率提供不确定性量化,区别于如基于EM的稀疏潜在因子模型等频率学派方法。
提出的方法
- 提出一种双特征分配(DFA)模型,联合将特征(潜在疾病)分配给EHR类别矩阵的行(患者)和列(症状)。
- 扩展印度餐厅过程(IBP)以允许患者和症状的重叠、非排他性疾病分配,且潜在疾病数量未知且灵活。
- 采用分层贝叶斯模型,将已知诊断和症状-疾病关联作为网络中的固定边编码,提升模型可识别性。
- 使用马尔可夫链蒙特卡洛(MCMC)进行后验推断,支持症状-疾病关系后验概率的估计(可视化中以连线粗细表示)。
- 对连续检验值进行离散化处理(如正常/异常),以整合临床参考范围并降低对噪声和异常值的敏感性。
- 在完全随机缺失(MCAR)假设下处理缺失数据,通过从似然函数中省略缺失条目,利用标准矩阵补全原理。
实验结果
研究问题
- RQ1贝叶斯双特征分配模型是否能有效从EHR数据中推断潜在疾病,而无需依赖标注的诊断?
- RQ2整合已知诊断和症状-疾病关联的先验知识在多大程度上提升了潜在疾病结构的可解释性与可识别性?
- RQ3DFA模型在捕捉患者-疾病与症状-疾病之间重叠的多对多关系方面,相较于稀疏潜在因子模型(SLFM)和图模型,表现如何?
- RQ4在模型误设或存在噪声的数据条件下,尤其在真实世界EHR环境中,该模型的性能如何?
- RQ5该模型能否提供具有不确定性量化的有意义的患者层面疾病概率估计,以支持临床优先级排序?
主要发现
- DFA模型在中文EHR数据中成功识别出10种潜在疾病,包括脂质代谢障碍、血小板减少症、红细胞增多症、贫血、细菌与病毒感染、过敏和营养不良,其中多数与临床知识相符。
- 模型推断出的肾功能损伤患病率与区域平均水平相当,但略高,表明其与现实世界具有合理的契合度。
- 症状-疾病关系的后验概率通过连线粗细可视化,提供了具有不确定性感知的推断——例如,更强关联以更粗的线条表示,相比点估计提供了更细致的解释。
- 在患者层面推断方面,DFA模型优于SLFM,因为SLFM不支持个体患者-疾病概率估计,而这是临床应用的关键优势。
- 共识蒙特卡洛算法实现了在n=15,000规模数据集上的可扩展推断,耗时不足5分钟,且估计性能与小样本数据集上的MCMC相当。
- 对连续检验值进行离散化处理提升了对噪声和异常值的鲁棒性,并整合了临床参考范围,但若类别过少可能导致信息损失。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。