[论文解读] Deep IDA: A Deep Learning Method for Integrative Discriminant Analysis of Multi-View Data with Feature Ranking -- An Application to COVID-19 severity
Deep IDA 是一种深度学习框架,能够联合建模多组学视角(如蛋白质组学、转录组学、代谢组学)之间的非线性关系,并区分重症新冠肺炎(ICU 与非 ICU)严重程度。该框架利用深度神经网络学习非线性投影,以最大化视角关联性和类别分离性,同时结合基于自助法的特征排序方法,识别出具有生物学可解释性的分子特征,其分类性能优于当前最先进方法,并揭示了与感染、癌症及代谢疾病相关的富集通路。
COVID-19 severity is due to complications from SARS-Cov-2 but the clinical course of the infection varies for individuals, emphasizing the need to better understand the disease at the molecular level. We use clinical and multiple molecular data (or views) obtained from patients with and without COVID-19 who were (or not) admitted to the intensive care unit to shed light on COVID-19 severity. Methods for jointly associating the views and separating the COVID-19 groups (i.e., one-step methods) have focused on linear relationships. The relationships between the views and COVID-19 patient groups, however, are too complex to be understood solely by linear methods. Existing nonlinear one-step methods cannot be used to identify signatures to aid in our understanding of the complexity of the disease. We propose Deep IDA (Integrative Discriminant Analysis) to address analytical challenges in our problem of interest. Deep IDA learns nonlinear projections of two or more views that maximally associate the views and separate the classes in each view, and permits feature ranking for interpretable findings. Our applications demonstrate that Deep IDA has competitive classification rates compared to other state-of-the-art methods and is able to identify molecular signatures that facilitate an understanding of COVID-19 severity.
研究动机与目标
- 解决线性方法和无监督多视角方法在建模多组学数据与新冠肺炎严重程度之间复杂非线性关系方面的局限性。
- 开发一种一步式深度学习方法,同时最大化多个视角之间的关联性与疾病组别(ICU 与非 ICU)之间的分离性。
- 将特征排序整合进非线性多视角学习框架,以实现所识别分子特征的生物学可解释性。
- 在多组学研究中典型的高维、小样本场景下,提升分类性能。
提出的方法
- Deep IDA 使用深度神经网络将每个组学视角非线性地转换为低维表示。
- 其构建了一个优化问题,以最大化变换后各视角之间的线性相关性,同时最大化各视角内部的线性分离性。
- 采用基于自助法的重采样技术,根据特征对视角关联性和类别分离性的贡献程度对特征进行排序,从而实现可解释的特征选择。
- 该方法在 Python 中实现,包含两阶段流程:第一阶段通过重采样筛选出顶级特征;第二阶段在这些特征上训练新的深度模型,生成最终的低维表示。
- 该框架支持二元或分类结果,且可扩展至其他结果类型。
- 通过模拟实验和真实多组学数据的应用对方法进行了验证,结果与当前最先进方法进行比较。
实验结果
研究问题
- RQ1深度学习框架能否联合建模多个组学视角之间的非线性关联,并比现有线性或无监督方法更有效地分类疾病严重程度?
- RQ2哪些分子特征(蛋白质、代谢物、转录本)对视角之间的关联性和新冠肺炎患者组别分离贡献最大?
- RQ3所提出的特征排序方法能否识别出具有生物学意义的特征,以解释新冠肺炎严重程度的分子结构?
- RQ4Deep IDA 在多组学数据中常见的高维、小样本设置下的表现如何?
- RQ5在顶级特征中富集的生物通路是什么?它们是否与 SARS-CoV-2 病理机制的已知通路一致?
主要发现
- 即使在高维、小样本设置下,Deep IDA 的分类准确率也与当前最先进线性及非线性方法相当,表现优异。
- 该方法成功识别出一组顶级分子(蛋白质、代谢物和转录本),能更有效地区分 ICU 与非 ICU 新冠肺炎患者。
- 对顶级特征进行富集分析,揭示了与癌症、神经系统疾病、感染性疾病及代谢疾病通路显著相关的富集结果。
- 基于自助法的特征排序方法提供了稳定且可解释的特征重要性评分,使研究者能够获得超越模型性能的生物学洞见。
- 顶级特征在自助重采样中保持一致,凸显了与脂质转运和免疫失调相关的关键分子,与严重新冠研究中的既往发现一致。
- 该方法在模拟实验和真实数据应用中均表现出稳健性,具有指导关键分子驱动因素进一步实验验证的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。