Skip to main content
QUICK REVIEW

[论文解读] Locally Sparse Neural Networks for Tabular Biomedical Data

Junchen Yang, Ofir Lindenbaum|arXiv (Cornell University)|Jun 11, 2021
Explainable Artificial Intelligence (XAI)被引用 11
一句话总结

该论文提出了一种新型可解释深度学习框架——局部稀疏神经网络(LSPIN),用于表格型生物医学数据,通过可训练的门控网络学习样本特定的特征重要性。通过采用概率ℓ₀类正则化实现局部稀疏性,LSPIN在低样本量、高维生物医学场景下,相较于最先进模型展现出更优的性能与可解释性。

ABSTRACT

Tabular datasets with low-sample-size or many variables are prevalent in biomedicine. Practitioners in this domain prefer linear or tree-based models over neural networks since the latter are harder to interpret and tend to overfit when applied to tabular datasets. To address these neural networks' shortcomings, we propose an intrinsically interpretable network for heterogeneous biomedical data. We design a locally sparse neural network where the local sparsity is learned to identify the subset of most relevant features for each sample. This sample-specific sparsity is predicted via a extit{gating} network, which is trained in tandem with the extit{prediction} network. By forcing the model to select a subset of the most informative features for each sample, we reduce model overfitting in low-sample-size data and obtain an interpretable model. We demonstrate that our method outperforms state-of-the-art models when applied to synthetic or real-world biomedical datasets using extensive experiments. Furthermore, the proposed framework dramatically outperforms existing schemes when evaluating its interpretability capabilities. Finally, we demonstrate the applicability of our model to two important biomedical tasks: survival analysis and marker gene identification.

研究动机与目标

  • 解决深度神经网络在低样本量、高维表格型生物医学数据上应用时面临的过拟合与可解释性差的问题。
  • 克服全局特征选择方法在异质性生物医学数据集中难以捕捉特征样本特定相关性的局限。
  • 开发一种内在可解释的神经网络框架,通过学习局部稀疏模式(即每一样本选择不同特征)实现可解释性,而无需依赖事后解释方法。
  • 证明线性预测器结合局部稀疏性可在真实世界生物医学数据集上超越复杂非线性模型。
  • 将该框架扩展至关键生物医学任务,如生存分析与标志基因识别,展示其在标准分类与回归任务之外的实际应用价值。

提出的方法

  • 提出一种局部稀疏可解释网络(LSPIN),结合预测网络与门控网络,以学习样本特定的特征重要性。
  • 通过重参数化(高斯噪声)实现概率ℓ₀类正则化,诱导稳定的局部稀疏性,使每个样本仅激活部分特征。
  • 通过最小化共享的回归或分类损失,联合训练门控网络与预测网络,实现端到端的特征选择与预测学习。
  • 应用亲和核(affinity kernel)确保相似样本具有相似的稀疏模式,提升局部特征选择的泛化性与稳定性。
  • 采用可微门控机制结合Concrete松弛,实现稀疏选择过程的反向传播,支持基于梯度的优化。
  • 将框架集成至生存分析(通过Cox比例风险模型)与标志基因识别任务中,保持可解释性与性能。

实验结果

研究问题

  • RQ1具有样本特定特征选择的深度神经网络是否能在低样本量、高维生物医学表格数据上超越标准模型?
  • RQ2与全局特征选择相比,局部稀疏性(即每一样本选择不同特征)是否能提升模型泛化能力并减少过拟合?
  • RQ3局部稀疏神经网络是否能在保持内在可解释性的同时,实现比最先进非线性模型更高的预测性能?
  • RQ4LSPIN框架在真实世界生物医学应用(如生存分析与标志基因识别)中的表现如何?
  • RQ5与黑箱模型或全局特征选择相比,该模型的可解释性在多大程度上能促成有意义的生物学洞见?

主要发现

  • LSPIN在合成数据与真实世界生物医学数据集上均优于最先进模型(包括DeepSurv、TabNet、L2X与INVASE),尤其在低样本量场景下表现更优。
  • 在真实数据集的生存分析中,COX-LSPIN在10折交叉验证中达到中位一致性指数0.78,显著优于随机生存森林与COX-LASSO。
  • 该模型平均每一样本仅选择10–15%的特征,却保持了高预测准确率,证明了其有效的局部稀疏性。
  • 在单细胞RNA-seq数据集中,LSPIN正确将已知标志基因(如ITGAM与PDGFRA)识别为各自细胞类型中的主要贡献者,验证了其生物学可解释性。
  • 即使在无非线性激活的情况下,线性LSPIN模型仍优于DeepSurv与COX-STG(Nonlinear)等非线性模型,凸显了在HDLSS(高维小样本)场景下局部稀疏性的强大优势。
  • 门控网络成功识别出每一样本的生物学相关特征,且由于亲和核正则化,模型在相似样本上的预测结果保持稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。