Skip to main content
QUICK REVIEW

[论文解读] Genetic Architect: Discovering Genomic Structure with Learned Neural Architectures

Laura Deming, Sasha Targ|arXiv (Cornell University)|May 23, 2016
RNA and protein synthesis mechanisms参考文献 16被引用 12
一句话总结

本文提出了遗传架构(Genetic Architect)——一种神经架构搜索框架,通过迭代探索架构组件,自动发现适用于基因组学的最优深度学习架构。该方法在基因表达预测任务中超越了最先进模型,识别出具有生物学可解释性的序列基序,并仅使用RNA-seq数据即可学习到人类可读的功能基因组元件可视化结果。

ABSTRACT

Each human genome is a 3 billion base pair set of encoding instructions. Decoding the genome using deep learning fundamentally differs from most tasks, as we do not know the full structure of the data and therefore cannot design architectures to suit it. As such, architectures that fit the structure of genomics should be learned not prescribed. Here, we develop a novel search algorithm, applicable across domains, that discovers an optimal architecture which simultaneously learns general genomic patterns and identifies the most important sequence motifs in predicting functional genomic outcomes. The architectures we find using this algorithm succeed at using only RNA expression data to predict gene regulatory structure, learn human-interpretable visualizations of key sequence motifs, and surpass state-of-the-art results on benchmark genomics challenges.

研究动机与目标

  • 为解决在基因组学中设计高效深度学习架构的挑战,其中底层数据结构尚不明确。
  • 开发一种搜索框架,学习最优架构,而非依赖人工设计的先验知识。
  • 识别出高性能模型以及对预测基因调控功能至关重要的可解释序列基序。
  • 仅使用RNA表达数据,在标准基因组学基准任务上超越最先进性能。

提出的方法

  • 该框架在标准和先进的神经网络组件(包括卷积、残差块、注意力机制、RNN和全连接层)上执行迭代架构搜索。
  • 采用基于贝叶斯优化的搜索策略,探索滤波器数量、卷积核大小、池化类型、归一化方法、dropout率和激活函数等超参数。
  • 搜索空间包含架构选择,如残差连接、注意力模块、双向RNN和全局池化策略。
  • 模型在启动子序列数据上进行训练和评估,以表达水平为目标,使用交叉验证评估性能。
  • 通过分析注意力权重和卷积滤波器模式,生成可解释的可视化结果,以识别关键功能基序。
  • 采用基于决策树的可视化工具,突出显示在表现最佳的模型中最具影响力的超参数和架构选择。

实验结果

研究问题

  • RQ1神经架构搜索框架是否能在不依赖领域特定架构先验知识的情况下,自动发现适用于基因组学的最优深度学习架构?
  • RQ2在从启动子序列预测基因表达时,哪些架构组件和超参数最能预测高性能表现?
  • RQ3所发现的模型是否能识别出对人类专家具有生物学意义且可解释的序列基序?
  • RQ4与手工设计的模型相比,自动发现的架构在标准基因组学基准任务上的性能如何?
  • RQ5在学习到的架构中,注意力机制和卷积滤波器在多大程度上能揭示非编码DNA中的功能调控元件?

主要发现

  • 遗传架构在仅使用RNA-seq数据作为输入的情况下,发现了超越最先进水平的基因表达预测任务性能的架构。
  • 该框架通过注意力机制和卷积滤波器可视化,成功识别出具有生物学相关性的序列基序,使人类能够解释功能元件。
  • 在启动子区域(转录起始位点±1 kb)上训练的模型,在11种免疫细胞谱系中均实现了高精度的谱系特异性基因表达预测。
  • 表现最佳的架构一致地使用了残差块、注意力机制,以及3x1或5x1卷积,并结合批量归一化和ELU激活函数。
  • 搜索过程表明,注意力机制和残差连接显著提升了模型性能和泛化能力。
  • 该框架的可视化工具突出显示了关键超参数,如滤波器数量(64)、注意力使用情况以及dropout率(0.2–0.3),这些因素对表现前20%的模型影响最大。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。