Skip to main content
QUICK REVIEW

[论文解读] A New Deep Learning and XAI-Based Algorithm for Features Selection in Genomics

Carlo Adornetto, Gianluigi Greco|arXiv (Cornell University)|Mar 29, 2023
Genetics, Bioinformatics, and Biomedical Research被引用 5
一句话总结

本文提出了一种基于深度学习与可解释人工智能(XAI)的新型基因特征选择算法,用于基因组学分析。该方法利用自编码器(AEs)在不改变原始特征空间的前提下识别出具有信息量的基因,并采用自定义的SHAP评分实现迭代选择。该方法应用于包含19,367个基因和97名患者的慢性淋巴细胞白血病(CLL)数据集,将特征减少至50个,交叉验证中实现了100%的分类准确率,并识别出与预后相关的生物学意义显著的基因。

ABSTRACT

In the field of functional genomics, the analysis of gene expression profiles through Machine and Deep Learning is increasingly providing meaningful insight into a number of diseases. The paper proposes a novel algorithm to perform Feature Selection on genomic-scale data, which exploits the reconstruction capabilities of autoencoders and an ad-hoc defined Explainable Artificial Intelligence-based score in order to select the most informative genes for diagnosis, prognosis, and precision medicine. Results of the application on a Chronic Lymphocytic Leukemia dataset evidence the effectiveness of the algorithm, by identifying and suggesting a set of meaningful genes for further medical investigation.

研究动机与目标

  • 解决基因组数据分析中高维性、类别不平衡和数据异质性带来的挑战。
  • 开发一种在保留可解释性的同时利用深度学习表征的特征选择方法。
  • 识别出一组最小但具有生物学意义的基因,用于预测慢性淋巴细胞白血病(CLL)的预后。
  • 整合自编码器与基于SHAP的可解释性方法,以提升模型透明度和特征相关性量化。
  • 为精准医学中候选基因的进一步医学研究提供一个框架。

提出的方法

  • 该算法基于相关性矩阵采用层次聚类方法对基因进行聚类,形成500个初始基因组。
  • 针对每个基因组,训练一个自编码器以重建原始基因表达谱,利用重建误差筛选掉冗余基因。
  • 使用SHAP值计算自定义的XAI评分,按其对模型预测的贡献程度对特征进行排序。
  • 通过基于阈值的选择方法(β = 0.85)从每个基因组中迭代选择最优点特征,被选中的基因将不再参与后续考虑。
  • 在选定的基因子集上训练最终的神经网络,并重新计算SHAP值以验证特征重要性。
  • 在模型训练前,使用SMOTE对类别不平衡问题(23例类别0,74例类别1)进行重采样以实现再平衡。

实验结果

研究问题

  • RQ1混合深度学习与XAI的方法是否能有效降低基因组特征空间,同时保持预测性能?
  • RQ2自编码器如何在不改变原始空间维度的前提下,识别出每个聚类中的代表性基因?
  • RQ3基于SHAP的特征选择评分在基因组分类任务中,对模型可解释性和性能的提升程度如何?
  • RQ4该算法能否识别出一组小而具有生物学意义的基因,用于预测CLL的预后?
  • RQ5基于SHAP值的迭代特征选择如何影响各次迭代中模型的准确率?

主要发现

  • 该算法通过迭代选择成功将19,367个基因减少至50个具有信息量的特征,最终模型在交叉验证中实现了100%的分类准确率。
  • 在初始迭代阶段,模型准确率下降(从77.2%降至64.3%),这是由于逐步移除了表现最佳的特征,但在最后一步实现回升。
  • 在10折交叉验证中,最终模型的准确率置信区间为79.1%至92.9%。
  • 所选的50个基因在SHAP值可视化中表现出强烈的关联性和强度模式,表明其具有生物学相关性。
  • 该方法识别出一组具有高预测能力且可解释的基因,适合在CLL预后研究中进一步开展医学调查。
  • 自编码器重建误差与SHAP评分的结合,实现了无需改变原始特征空间的有效且可解释的特征选择。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。