Skip to main content
QUICK REVIEW

[论文解读] Deep Learning for Metagenomic Data: using 2D Embeddings and Convolutional Neural Networks

Thanh Hai Nguyen, Yann Chevaleyre|arXiv (Cornell University)|Dec 1, 2017
Gene expression and cancer classificationBiochemistry, Genetics and Molecular Biology参考文献 27被引用 17
一句话总结

该论文提出 MET2IMG,一种深度学习框架,通过系统发育排序或 t-SNE 嵌入将宏基因组数据转换为二维图像表示,从而有效应用卷积神经网络(CNN)进行疾病预测。该方法在六个宏基因组数据集上达到最先进性能,基于 t-SNE 的图像上使用 2D CNN 的表现优于传统机器学习方法和原始数据,尤其在炎症性肠病(IBD)和 2 型糖尿病(T2D)等复杂疾病中表现更优。

ABSTRACT

Deep learning (DL) techniques have had unprecedented success when applied to images, waveforms, and texts to cite a few. In general, when the sample size (N) is much greater than the number of features (d), DL outperforms previous machine learning (ML) techniques, often through the use of convolution neural networks (CNNs). However, in many bioinformatics ML tasks, we encounter the opposite situation where d is greater than N. In these situations, applying DL techniques (such as feed-forward networks) would lead to severe overfitting. Thus, sparse ML techniques (such as LASSO e.g.) usually yield the best results on these tasks. In this paper, we show how to apply CNNs on data which do not have originally an image structure (in particular on metagenomic data). Our first contribution is to show how to map metagenomic data in a meaningful way to 1D or 2D images. Based on this representation, we then apply a CNN, with the aim of predicting various diseases. The proposed approach is applied on six different datasets including in total over 1000 samples from various diseases. This approach could be a promising one for prediction tasks in the bioinformatics field.

研究动机与目标

  • 解决在特征数量(d)远超样本量(N)的宏基因组数据中应用深度学习时导致的标准深度学习模型过拟合的问题。
  • 开发有意义的宏基因组数据二维图像表示方法——采用系统发育排序和 t-SNE 嵌入——以保留生物结构并促进 CNN 的有效学习。
  • 证明基于这些合成图像的 2D CNN 能够在宏基因组数据集上实现优于传统机器学习方法(如随机森林和 SVM)的分类性能。
  • 评估不同数据表示方式(丰度 vs. 存在)以及网络架构(1D 与 2D 卷积)对预测准确率的影响。

提出的方法

  • 通过‘填充可视化’将宏基因组丰度数据转换为二维图像:按系统发育树对物种排序,并按行从左到右、从上到下填充,使用对数尺度的颜色编码丰度区间。
  • 应用 t-SNE 降维将高维宏基因组样本投影到二维空间,保留局部相似性,并将结果可视化为图像,其中颜色表示物种丰度或存在性。
  • 在这些图像表示上训练 2D 和 1D 卷积神经网络(CNN),网络架构包括 5 层(2D)或 2 层(1D)卷积层,每层含 20 个滤波器和 ReLU 激活函数。
  • 使用宽卷积以保留空间维度,并通过最大池化(2×2,步长 2)下采样特征图,随后接全连接层和 LogSoftMax 输出层,用于二分类。
  • 采用两种分类策略:两节点输出使用 LogSoftMax 和交叉熵损失,以及单节点输出使用 Sigmoid 和二元交叉熵;两节点方法表现更优,被用于最终模型。
  • 使用随机梯度下降(SGD)和 Adam 优化器进行模型优化,小批量大小为 16,初始学习率 0.0005,动量 0.1,权重衰减为 1e-5。

实验结果

研究问题

  • RQ1尽管宏基因组数据具有高维性和小样本量的特性,基于宏基因组数据的二维图像表示是否能有效支持卷积神经网络的训练?
  • RQ2不同的数据表示方式——系统发育排序(PLG)与 t-SNE 嵌入——对基于 CNN 的疾病预测模型性能有何影响?
  • RQ3在图像转换后的宏基因组数据上使用 2D 卷积是否优于在原始数据上使用 1D 卷积或全连接网络,从而提升分类准确率?
  • RQ4与最先进的机器学习方法(如随机森林和 SVM)相比,基于图像的表示在宏基因组数据集上能多大程度提升预测性能?
  • RQ5基于丰度(ABD)与存在性(PRE)的特征表示在不同疾病中的模型性能表现如何?

主要发现

  • MET2IMG 框架在六个宏基因组数据集上达到最先进性能,基于 t-SNE 图像的 2D CNN 表现优于传统机器学习方法(如随机森林和 SVM)。
  • 在 IBD 数据集中,基于 t-SNE 图像的 2D CNN 在 PRE 表示下达到 81.8% 的准确率(Con2D, PRE),超过最佳 MetAML 结果的 80.9%,并展现出相对于基线的最高提升。
  • 在 T2D 数据集中,基于 t-SNE 图像的 2D CNN 在 PRE 表示下达到 71.1% 的准确率(Con2D, t-SNE),超过最佳 MetAML 结果的 70.3%,在复杂代谢性疾病中表现强劲。
  • 2D 卷积在所有数据集上均持续优于 1D 卷积,表明 2D 图像表示中的空间结构有助于提升特征学习能力。
  • 基于 t-SNE 的图像表示需要更高的图像尺寸(如 64×64)以避免数据点重叠并提升性能,尽管其计算资源消耗高于 PLG 方法。
  • 两节点 LogSoftMax 输出层在 2D CNN 上的表现优于单节点 Sigmoid 方法,证实其在本研究背景下对二分类任务的优越性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。