[论文解读] Feature versus Raw Sequence: Deep Learning Comparative Study on Predicting Pre-miRNA
本研究比较了基于原始miRNA序列与工程化特征的深度学习模型在前体miRNA预测中的表现。使用原始序列的6层卷积神经网络(CNN)达到了99.5%的准确率,略高于基于20个选定特征的3层深度置信网络(DBN)模型(准确率为99.0%),表明在数据充足的情况下,设计良好的原始序列模型可替代基于特征的方法。
Should we input known genome sequence features or input sequence itself in deep learning framework? As deep learning more popular in various applications, researchers often come to question whether to generate features or use raw sequences for deep learning. To answer this question, we study the prediction accuracy of precursor miRNA prediction of feature-based deep belief network and sequence-based convolution neural network. Tested on a variant of six-layer convolution neural net and three-layer deep belief network, we find the raw sequence input based convolution neural network model performs similar or slightly better than feature based deep belief networks with best accuracy values of 0.995 and 0.990, respectively. Both the models outperform existing benchmarks models. The results shows us that if provided large enough data, well devised raw sequence based deep learning models can replace feature based deep learning models. However, construction of well behaved deep learning model can be very challenging. In cased features can be easily extracted, feature-based deep learning models may be a better alternative.
研究动机与目标
- 确定在前体miRNA预测的深度学习模型中,原始RNA序列与预先提取的序列特征哪种能带来更好的性能。
- 评估直接在原始核苷酸序列上训练的卷积神经网络(CNN)与基于生物相关特征的深度置信网络(DBN)的有效性。
- 将这些深度学习模型的性能与现有基准方法(如SVM、随机森林和朴素贝叶斯分类器)进行比较。
- 探究端到端的原始序列学习是否能消除前体miRNA分类中手工特征工程的需要。
提出的方法
- 在原始核苷酸序列上训练了一个6层卷积神经网络(CNN),使用大小为18的卷积核、步长为4,共20个滤波器,随后是两个全连接层,分别包含90个和2个神经元。
- 实现了第二种CNN架构,包含两个卷积层(滤波器大小分别为12和6,步长为1),随后是最大池化层(窗口大小为6,步长为4),以及两个全连接层,最终输出层为2个神经元。
- 在两个CNN模型的输出层使用0.3的dropout比率以防止过拟合。
- 构建了一个包含三个隐层(分别包含100、70、35个神经元)的深度置信网络(DBN),在58个和20个生物相关特征上进行训练,包括自由能、熔解温度和碱基配对统计量等。
- 对DBN模型进行了20次独立运行以应对随机性,并对结果取平均以提高稳定性。
- 使用准确率和F1-score评估模型,并与SVM、MiRANN和Triplet-SVM等成熟方法进行比较。
实验结果
研究问题
- RQ1在前体miRNA预测中,直接在原始RNA序列上训练的深度学习模型是否优于使用手工设计序列特征的模型?
- RQ2在不同特征子集上,基于原始序列的CNN与基于特征集的DBN在性能指标(准确率、F1-score)上的表现如何比较?
- RQ3基于原始序列的深度学习模型是否能在前体miRNA分类中实现高于传统机器学习模型(如SVM和随机森林)的准确率?
- RQ4在生物序列数据有限的情况下,模型深度和架构设计对性能有何影响?
主要发现
- 基于原始序列的6层CNN模型取得了最高的准确率0.995,显著优于基于特征的DBN模型。
- 在20个选定特征上训练的DBN模型准确率达到0.990,略高于使用58个特征时获得的0.968准确率。
- 两种深度学习模型(CNN和DBN)在前体miRNA预测中均优于现有的基准方法,如SVM、朴素贝叶斯和随机森林。
- 采用两层卷积层架构(滤波器大小分别为12和6,步长为1)并随后接最大池化的CNN模型表现出较高性能,表明更深的架构可增强特征提取能力。
- 尽管原始序列模型具有潜力,但由于数据限制和超参数敏感性,构建高性能深度学习架构仍具挑战性。
- 当存在高质量且易于提取的特征时,基于特征的DBN可能仍是更优选择,因其鲁棒性更强且架构复杂度更低。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。