Skip to main content
QUICK REVIEW

[论文解读] Simultaneous imputation and disease classification in incomplete medical datasets using Multigraph Geometric Matrix Completion (MGMC)

Gerome Vivar, Anees Kazi|arXiv (Cornell University)|May 14, 2020
Bioinformatics and Genomic Networks参考文献 42被引用 7
一句话总结

该论文提出多图几何矩阵补全(MGMC),一种端到端的深度学习框架,通过利用多个循环图卷积网络,联合完成不完整多模态医疗数据集中的缺失值填补与疾病分类。MGMC基于临床元特征(如年龄、性别)构建独立的患者群体图,通过自注意力机制融合信号,并在阿尔茨海默病和帕金森病数据集上实现了最先进性能,通过在填补过程中保留与类别相关特征实现。

ABSTRACT

Large-scale population-based studies in medicine are a key resource towards better diagnosis, monitoring, and treatment of diseases. They also serve as enablers of clinical decision support systems, in particular Computer Aided Diagnosis (CADx) using machine learning (ML). Numerous ML approaches for CADx have been proposed in literature. However, these approaches assume full data availability, which is not always feasible in clinical data. To account for missing data, incomplete data samples are either removed or imputed, which could lead to data bias and may negatively affect classification performance. As a solution, we propose an end-to-end learning of imputation and disease prediction of incomplete medical datasets via Multigraph Geometric Matrix Completion (MGMC). MGMC uses multiple recurrent graph convolutional networks, where each graph represents an independent population model based on a key clinical meta-feature like age, sex, or cognitive function. Graph signal aggregation from local patient neighborhoods, combined with multigraph signal fusion via self-attention, has a regularizing effect on both matrix reconstruction and classification performance. Our proposed approach is able to impute class relevant features as well as perform accurate classification on two publicly available medical datasets. We empirically show the superiority of our proposed approach in terms of classification and imputation performance when compared with state-of-the-art approaches. MGMC enables disease prediction in multimodal and incomplete medical datasets. These findings could serve as baseline for future CADx approaches which utilize incomplete datasets.

研究动机与目标

  • 为解决用于临床决策支持和计算机辅助诊断(CADx)的多模态医疗数据集中缺失数据的挑战。
  • 开发一种端到端学习框架,无需数据删除或单独填补步骤,同时填补缺失特征并分类疾病状态。
  • 通过基于不同临床元特征(如年龄、性别和认知功能)的多张图建模患者群体,提升填补与分类性能。
  • 利用图信号聚合与自注意力融合,对矩阵重建与疾病分类任务进行正则化。

提出的方法

  • MGMC采用多个独立的循环图卷积网络(RGCNs),每个网络在基于关键临床元特征(如年龄、性别、认知评分)构建的独立图上进行训练。
  • 每张图代表一个群体模型,患者相似性通过元特征计算,形成图拉普拉斯矩阵以支持谱消息传递。
  • 通过局部患者邻域聚合图信号,利用循环图卷积实现患者关系的序列建模。
  • 通过自注意力机制实现多图信号融合,动态加权各图的贡献,生成统一表征。
  • 框架采用联合损失函数进行端到端训练,结合矩阵重建(填补)与分类目标。
  • 架构在每个图分支中使用非自回归LSTM,以在不依赖序列自回归的情况下保留长距离依赖。

实验结果

研究问题

  • RQ1统一的深度学习框架是否能比独立或顺序方法更有效地在不完整医疗数据集中联合执行填补与疾病分类?
  • RQ2通过基于不同元特征的多张图建模患者群体,相比单图或非图基线,是否能显著提升填补与分类性能?
  • RQ3基于自注意力的多图信号融合在多大程度上增强了模型的泛化能力与对缺失数据的鲁棒性?
  • RQ4在本场景中,与自回归变体相比,非自回归LSTM在循环GCN中的使用是否能提升性能与训练稳定性?
  • RQ5MGMC是否能在真实世界神经退行性疾病数据集上,同时优于最先进方法在填补准确率与疾病分类性能方面?

主要发现

  • 与最先进方法(包括低秩矩阵补全LRMC和潜在表征学习方法)相比,MGMC在ADNI和PPMI数据集上实现了更优的分类性能。
  • 通过在重建过程中保留与类别相关特征,模型显著提升了填补准确率,尤其在多模态和高维数据设置下表现突出。
  • 消融研究证实,非自回归LSTM与自注意力机制对性能均至关重要,任一模块的移除均导致性能显著下降。
  • 使用基于多个元特征的图相比单图或非图基线,展现出更好的泛化能力与鲁棒性。
  • MGMC在两个不同的神经退行性疾病队列中表现出强大的可迁移性与泛化能力,表明其作为未来不完整数据下CADx系统基线的潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。