Skip to main content
QUICK REVIEW

[论文解读] PromID: human promoter prediction by deep learning

Ramzan Umarov, Hiroyuki Kuwahara|arXiv (Cornell University)|Oct 2, 2018
Genomics and Chromatin Dynamics参考文献 16被引用 5
一句话总结

PromID 提出了一种深度学习方法,通过自适应构建的负样本集迭代优化模型性能,实现对人类核心启动子的精确预测,显著降低了假阳性率。其召回率为 0.76,精确率为 0.77,Matthews相关系数(MCC)为 0.76,显著优于现有工具 FPROM,后者在相似召回率水平下的精确率(0.48)和 MCC(0.60)均较低。

ABSTRACT

Computational identification of promoters is notoriously difficult as human genes often have unique promoter sequences that provide regulation of transcription and interaction with transcription initiation complex. While there are many attempts to develop computational promoter identification methods, we have no reliable tool to analyze long genomic sequences. In this work we further develop our deep learning approach that was relatively successful to discriminate short promoter and non-promoter sequences. Instead of focusing on the classification accuracy, in this work we predict the exact positions of the TSS inside the genomic sequences testing every possible location. We studied human promoters to find effective regions for discrimination and built corresponding deep learning models. These models use adaptively constructed negative set which iteratively improves the models discriminative ability. The developed promoter identification models significantly outperform the previously developed promoter prediction programs by considerably reducing the number of false positive predictions. The best model we have built has recall 0.76, precision 0.77 and MCC 0.76, while the next best tool FPROM achieved precision 0.48 and MCC 0.60 for the recall of 0.75. Our method is available at http://www.cbrc.kaust.edu.sa/PromID/.

研究动机与目标

  • 为解决长基因组序列中启动子预测的高假阳性率问题,该问题限制了现有工具在全基因组研究中的应用价值。
  • 通过预测精确的转录起始位点(TSS)位置,而非依赖二元的启动子/非启动子分类,提升 TSS 定位的准确性。
  • 开发一种直接从数据中学习序列模式的模型,无需对已知核心启动子元件做出先验假设,从而实现对新型调控基序的发现。
  • 通过自适应负样本集构建,聚焦于误分类样本,实现模型性能的迭代优化,增强判别能力。
  • 提供一种可靠且可扩展的工具,用于在长基因组序列中识别人类启动子,支持功能基因组学和疾病研究。

提出的方法

  • 基于高通量测序数据中已实验验证的人类核心启动子(含已知 TSS)的卷积神经网络(CNN)进行训练。
  • 采用迭代训练策略,对误分类序列进行动态重加权并重新训练,以提升真实启动子与假阳性之间的判别能力。
  • 采用自适应负样本集构建方法,即负样本(非启动子)根据前一轮迭代中模型的置信度选择,聚焦于难以区分的样本。
  • 从 TSS 位置上游 -200 bp 至下游 +400 bp 的区域提取序列特征,优化输入窗口以实现最大预测性能。
  • 应用特征显著性分析,识别对模型预测影响最大的核苷酸位置,揭示关键基序和保守区域。
  • 生成序列图谱和显著性图,可视化特定核苷酸及基序(如起始子区域、富含 GC 的元件)在启动子识别中的重要性。

实验结果

研究问题

  • RQ1基于基因组序列的深度学习模型能否准确预测人类启动子中转录起始位点(TSS)的确切位置?
  • RQ2通过动态更新的负样本集实现的迭代模型优化,如何提升长基因组序列上启动子预测的精确率?
  • RQ3在缺乏已知元件(如 TATA 框)的情况下,哪些序列特征和基序对人类核心启动子活性最具预测性?
  • RQ4模型在含 TATA 框与不含 TATA 框的启动子上的性能差异如何?为何在后者中预测错误率更高?
  • RQ5显著性分析能否揭示与已知启动子结构和功能元件一致的生物上有意义的序列模式?

主要发现

  • PromID 实现了 0.76 的召回率、0.77 的精确率和 0.76 的 Matthews 相关系数(MCC),显著优于次优工具 FPROM,后者在相似召回率水平下的精确率为 0.48,MCC 为 0.60。
  • 该模型在减少假阳性方面表现更优,尤其在全基因组分析中至关重要,因此前置工具存在过度误报的问题。
  • 模型识别出的最重要基序——CCCAGGACCATGTCT、GCTAGGTTGTTATGT 和 GTTCCCGGCCGGTGC——包含已知为真核生物启动子特征的富含 GC 的亚序列。
  • 特征显著性分析表明,TSS 位置(+1)的核苷酸对模型得分影响最大,其中 A 和 G 的影响最强,且 A 在含起始子的启动子中最为常见。
  • 从 -30 bp 到 -23 bp 的区域,若用 G 或 C 替换核苷酸,会表现出强烈的负面影响,表明对类似 TATA 框序列具有功能敏感性。
  • 在 -100 bp 以上区域,核苷酸偏好性表现为 C 最受青睐;在 +300 bp 以下区域,G 的影响最强,提示存在依赖上下文的调控信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。