[论文解读] Convolutional neural networks for structured omics: OmicsCNN and the OmicsConv layer
本文提出OmicsCNN,一种深度学习框架,通过新颖的OmicsConv Keras层将卷积神经网络(CNNs)适配于结构化组学数据,通过度量空间嵌入特征。该框架利用系统发育树上的帕里斯蒂克距离和多层网络扩散距离,使CNN能够处理宏基因组学和转录组学数据,在分类性能上优于传统模型(如SVM和随机森林),尤其在具有挑战性的IBD亚型分类中表现更优。
Convolutional Neural Networks (CNNs) are a popular deep learning architecture widely applied in different domains, in particular in classifying over images, for which the concept of convolution with a filter comes naturally. Unfortunately, the requirement of a distance (or, at least, of a neighbourhood function) in the input feature space has so far prevented its direct use on data types such as omics data. However, a number of omics data are metrizable, i.e., they can be endowed with a metric structure, enabling to adopt a convolutional based deep learning framework, e.g., for prediction. We propose a generalized solution for CNNs on omics data, implemented through a dedicated Keras layer. In particular, for metagenomics data, a metric can be derived from the patristic distance on the phylogenetic tree. For transcriptomics data, we combine Gene Ontology semantic similarity and gene co-expression to define a distance; the function is defined through a multilayer network where 3 layers are defined by the GO mutual semantic similarity while the fourth one by gene co-expression. As a general tool, feature distance on omics data is enabled by OmicsConv, a novel Keras layer, obtaining OmicsCNN, a dedicated deep learning framework. Here we demonstrate OmicsCNN on gut microbiota sequencing data, for Inflammatory Bowel Disease (IBD) 16S data, first on synthetic data and then a metagenomics collection of gut microbiota of 222 IBD patients.
研究动机与目标
- 通过为结构化组学数据建立特征距离的理论框架,克服CNN在非图像组学数据上的局限性。
- 开发一种通用的深度学习架构OmicsCNN,整合基于度量的卷积以处理组学数据。
- 通过合成数据预训练实现低样本量组学设置下的领域自适应。
- 提供可复现、无偏见的实验协议(DAP),以实现组学分类中诚实的性能评估。
- 在真实世界肠道微生物组数据上,验证方法在炎症性肠病(IBD)亚型中的有效性。
提出的方法
- OmicsConv是自定义的Keras层,通过学习或预定义的特征间距离度量计算卷积,实现基于邻域的过滤。
- 在宏基因组学中,系统发育树上的帕里斯蒂克距离定义特征邻近性;在转录组学中,通过四层多层网络整合基因本体语义相似性和基因共表达。
- 框架使用缩放指数线性单元(SELU)作为激活函数,采用Adam优化器,学习率为0.0005。
- 采用10×5折交叉验证数据分析协议(DAP)以防止过拟合和选择偏差,并使用Borda聚合进行特征排序。
- 通过在大规模合成数据集上预训练OmicsCNN,再在真实IBD数据上微调(冻结早期层),实现领域自适应。
- 完整流程使用Python/Scikit-Learn和Keras v2.0.8实现,部署于GPU加速的Azure基础设施。
实验结果
研究问题
- RQ1通过定义有意义的特征距离度量,卷积神经网络能否有效应用于非图像组学数据?
- RQ2与经典机器学习模型相比,OmicsCNN在低样本量组学数据集(如IBD肠道微生物组数据)上的表现如何?
- RQ3在真实数据有限的情况下,合成数据预训练能否提升组学分类任务的泛化能力?
- RQ4将生物知识(如系统发育树、基因本体)整合到距离度量中,对组学表征有何影响?
- RQ5OmicsCNN框架是否能产生比标准深度学习或浅层模型更具可解释性和鲁棒性的生物标志物?
主要发现
- OmicsCNN在分类回肠型克罗恩病(iCDf)时,Matthews相关系数(MCC)达到0.858,显著优于次佳模型(随机森林F1为0.920,但MCC较低),并超越LSVM(0.418)和MLPNN(0.401)。
- 在最具挑战性的任务——iCDf中,OmicsCNN相比基线LSVM的MCC提高了42%,表明其在罕见或复杂亚型上具有强大的泛化能力。
- 对于溃疡性结肠炎发作(UCf),OmicsCNN的MCC为0.741,与最佳表现的LSVM(0.740)相当,同时优于MLPNN(0.666)和RF(0.699)。
- 该框架在所有六个IBD亚型中均表现出稳健性,在六项任务中的四项中表现更优,尤其在CD和iCD等高复杂度条件下。
- 使用合成数据进行预训练实现了有效的领域自适应,使OmicsCNN在真实IBD样本有限的情况下仍能实现良好泛化。
- 随机化特征和标签实验验证了模型的合理性,表明性能提升并非源于过拟合或数据泄露。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。