[论文解读] Prediction of Prokaryotic and Eukaryotic Promoters Using Convolutional Deep Learning Neural Networks
本文提出一种基于卷积神经网络(CNNs)的深度学习方法,用于预测多种生物体中的原核与真核生物启动子,无需预先了解特定启动子基序,即可实现高精度预测。该方法在人类、拟南芥、大肠杆菌和枯草芽孢杆菌的启动子上均展现出最先进的性能,F1得分超过0.90,AUC值高于0.90,通过端到端的序列模式学习优于现有工具。
Accurate computational identification of promoters remains a challenge as these key DNA regulatory regions have variable structures composed of functional motifs that provide gene specific initiation of transcription. In this paper we utilize Convolutional Neural Networks (CNN) to analyze sequence characteristics of prokaryotic and eukaryotic promoters and build their predictive models. We trained the same CNN architecture on promoters of four very distant organisms: human, plant (Arabidopsis), and two bacteria (Escherichia coli and Mycoplasma pneumonia). We found that CNN trained on sigma70 subclass of Escherichia coli promoter gives an excellent classification of promoters and non-promoter sequences (Sn=0.90, Sp=0.96, CC=0.84). The Bacillus subtilis promoters identification CNN model achieves Sn=0.91, Sp=0.95, and CC=0.86. For human and Arabidopsis promoters we employ CNNs for identification of two well-known promoter classes (TATA and non-TATA promoters). CNNs models nicely recognize these complex functional regions. For human Sn/Sp/CC accuracy of prediction reached 0.95/0.98/0,90 on TATA and 0.90/0.98/0.89 for non-TATA promoter sequences, respectively. For Arabidopsis we observed Sn/Sp/CC 0.95/0.97/0.91 (TATA) and 0.94/0.94/0.86 (non-TATA) promoters. Thus, the developed CNN models (implemented in CNNProm program) demonstrated the ability of deep learning with grasping complex promoter sequence characteristics and achieve significantly higher accuracy compared to the previously developed promoter prediction programs. As the suggested approach does not require knowledge of any specific promoter features, it can be easily extended to identify promoters and other complex functional regions in sequences of many other and especially newly sequenced genomes. The CNNProm program is available to run at web server http://www.softberry.com.
研究动机与目标
- 开发一种通用的、无需依赖特征的启动子识别方法,适用于多种基因组的深度学习方法。
- 克服传统启动子预测工具依赖预定义序列基序的局限性。
- 评估单一CNN架构在进化上相距较远的生物体(包括人类、拟南芥、大肠杆菌和肺炎支原体)中的性能表现。
- 在真核生物中高精度地区分含TATA盒与不含TATA盒的启动子。
- 构建一个可扩展、公开可用的工具(CNNProm),用于新测序基因组的启动子预测。
提出的方法
- 在四个生物体(人类、拟南芥、大肠杆菌(σ70亚类)和肺炎支原体)的启动子序列上训练了共享的CNN架构。
- 模型利用卷积层自动学习局部序列模式,并通过池化层从DNA序列中提取分层特征。
- 在未经人工特征工程的原始核苷酸序列上进行训练,网络能够捕捉启动子区域中复杂且非线性的关系。
- 为真核生物分别训练了两个模型,基于序列模式对含TATA盒与不含TATA盒的启动子进行分类。
- 通过在独立测试集上进行交叉验证,使用敏感性(Sn)、特异性(Sp)和Youden指数(CC)评估性能。
- CNNProm网页服务器支持用户提供的基因组序列的实时预测。
实验结果
研究问题
- RQ1单一深度学习架构是否能准确识别进化上相距较远物种中的启动子?
- RQ2基于CNN的模型在启动子预测中的性能与传统基于基序的方法相比如何?
- RQ3相同的CNN架构是否能有效区分真核生物中含TATA盒与不含TATA盒的启动子类别?
- RQ4该模型在无需预先了解启动子特征的情况下,对新出现的、未见过的基因组的泛化能力如何?
- RQ5从原始DNA序列进行端到端学习是否优于依赖已知转录因子结合位点或保守基序的方法?
主要发现
- 在大肠杆菌σ70启动子上训练的CNN模型实现了90%的敏感性、96%的特异性和84%的Youden指数(CC),表现出强大的泛化能力。
- 在枯草芽孢杆菌启动子上,模型达到91%的敏感性、95%的特异性和86%的Youden指数,表明其在跨物种预测中具有鲁棒性。
- 在人类含TATA盒启动子中,模型实现了95%的敏感性、98%的特异性和90%的Youden指数,优于以往方法。
- 在人类非TATA启动子中,模型实现90%的敏感性、98%的特异性和89%的Youden指数,显示出在复杂区域的高精度。
- 在拟南芥中,模型对含TATA盒启动子的敏感性为95%,特异性为97%,Youden指数为91%;对非TATA启动子的敏感性为94%,特异性为94%,Youden指数为86%。
- CNNProm网页服务器可在无需预先了解启动子特征生物知识的前提下,实现对多样化及新测序基因组的准确、可扩展的启动子预测。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。