[论文解读] Rare Disease Detection by Sequence Modeling with Generative Adversarial Networks
本文提出一种结合长短期记忆(LSTM)网络的半监督生成对抗网络(GAN),用于从纵向医疗索赔数据中检测外分泌胰腺功能不全(EPI)。通过利用未标记的患者序列并生成合成正样本,该模型在包含180万名患者(其中29,149例为EPI)的数据集中实现了0.56的PR-AUC,优于基线模型在精确率和召回率上的表现。
Rare diseases affecting 350 million individuals are commonly associated with delay in diagnosis or misdiagnosis. To improve those patients' outcome, rare disease detection is an important task for identifying patients with rare conditions based on longitudinal medical claims. In this paper, we present a deep learning method for detecting patients with exocrine pancreatic insufficiency (EPI) (a rare disease). The contribution includes 1) a large longitudinal study using 7 years medical claims from 1.8 million patients including 29,149 EPI patients, 2) a new deep learning model using generative adversarial networks (GANs) to boost rare disease class, and also leveraging recurrent neural networks to model patient sequence data, 3) an accurate prediction with 0.56 PR-AUC which outperformed benchmark models in terms of precision and recall.
研究动机与目标
- 为解决由于极端类别不平衡和标注数据有限而导致的医疗领域罕见病检测挑战。
- 开发一种深度学习模型,有效利用纵向医疗索赔数据实现外分泌胰腺功能不全(EPI)的早期检测。
- 通过使用GAN进行半监督学习,利用未标记的患者序列提升模型性能。
- 通过直接使用RNN建模原始医疗编码序列,消除对手动特征工程的需求。
- 通过医学编码嵌入可视化和基准比较,验证模型的泛化能力和可解释性。
提出的方法
- 患者的医疗历史被表示为医疗编码序列(诊断、处方、操作),并通过带有负采样的跳字模型嵌入为300维的稠密向量。
- 长短期记忆(LSTM)网络将嵌入编码序列编码为固定长度的患者表征向量。
- 在半监督设置下训练生成对抗网络(GAN),其中判别器对真实正样本、真实负样本和生成样本进行分类,从而提升对罕见类别的泛化能力。
- 生成器生成合成患者序列以扩充真实EPI病例数量有限的问题,增强模型鲁棒性并减轻数据不平衡。
- 该框架采用混合损失函数,结合对抗损失和监督交叉熵损失,以稳定训练过程并提升性能。
- 最终模型通过精确率-召回率AUC(PR-AUC)进行评估,超参数通过在保留子集上的验证进行调优。
实验结果
研究问题
- RQ1当标注数据极度有限时,基于GAN的半监督学习框架能否有效提升罕见病检测性能?
- RQ2将基于LSTM的序列建模与对抗训练相结合,是否能在纵向电子健康记录(EHR)数据上实现优于标准深度学习模型的性能?
- RQ3医学编码嵌入在多大程度上能捕捉临床有意义的语义关系,其证据来自聚类模式?
- RQ4所提出的方法是否能在罕见病检测任务中实现高于传统模型(如逻辑回归、随机森林和XGBoost)的精确率和召回率?
- RQ5通过GAN引入未标记数据,在类别极度不平衡的设置下,对模型泛化能力和性能有何影响?
主要发现
- 所提出的SSL GAN模型实现了0.56的PR-AUC,相较于最佳基线模型(DNN的0.52 PR-AUC)相对提升了6%。
- 该模型在精确率和召回率上均优于逻辑回归、随机森林、XGBoost以及独立的DNN判别器,表明其在类别不平衡数据上的优越性能。
- 学习到的医学编码嵌入的t-SNE可视化揭示了有意义的聚类:呼吸系统和精神障碍的诊断与处方编码形成了清晰且语义一致的聚类组。
- GAN框架中使用未标记数据显著促进了性能提升,这一点在对比DNN基线时得到验证。
- 该框架通过端到端学习直接建模原始医疗编码序列,成功减少了对手动特征工程的需求。
- 该模型展现出强大的泛化潜力,其架构可轻松调整以检测其他罕见病,且修改极少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。