Skip to main content
QUICK REVIEW

[论文解读] Neural Architecture Search for Joint Optimization of Predictive Power and Biological Knowledge

Zijun Zhang, Linqi Zhou|arXiv (Cornell University)|Sep 1, 2019
Bioinformatics and Genomic Networks参考文献 22被引用 5
一句话总结

BioNAS 是一种神经架构搜索框架,通过联合优化深度学习模型在基因组学中的预测性能与生物学知识一致性,实现模型的可解释性提升。通过集成知识差异函数,BioNAS 发现了可解释的卷积神经网络架构,揭示了新型调控基序(如 U2AF2 3′-剪接位点模式),这些基序超越了现有的体外数据,增强了功能基因组学中模型的可解释性与生物学洞察力。

ABSTRACT

We report a neural architecture search framework, BioNAS, that is tailored for biomedical researchers to easily build, evaluate, and uncover novel knowledge from interpretable deep learning models. The introduction of knowledge dissimilarity functions in BioNAS enables the joint optimization of predictive power and biological knowledge through searching architectures in a model space. By optimizing the consistency with existing knowledge, we demonstrate that BioNAS optimal models reveal novel knowledge in both simulated data and in real data of functional genomics. BioNAS provides a useful tool for domain experts to inject their prior belief into automated machine learning and therefore making deep learning easily accessible to practitioners. BioNAS is available at https://github.com/zj-zhang/BioNAS-pub.

研究动机与目标

  • 通过在模型搜索中整合生物学知识,解决深度学习在基因组学中的黑箱问题。
  • 降低生命科学研究人员采用深度学习的计算与技术门槛。
  • 通过优化模型与现有实验知识的一致性,实现新型生物学知识的发现。
  • 在卷积神经网络架构中平衡预测准确率与可解释性,以实现基因组序列分析。
  • 通过为学习到的滤波器标注已知与新型基序,促进下游生物学解释。

提出的方法

  • 引入一类通用的知识差异函数家族,用于度量模型学习到的滤波器与现有生物学知识之间的一致性。
  • 构建基于控制器的神经架构搜索(NAS)框架,同时优化验证损失与知识差异。
  • 使用一位编码的基因组序列作为卷积神经网络的输入,实现序列属性的端到端学习。
  • 通过与已知 RBP 结合模式进行基序匹配,将训练后的卷积滤波器解码为具有生物学可解释性的基序。
  • 利用正交数据集——eCLIP(用于体内结合)与 RNAcompete(用于体外基序)——验证并扩展已知知识。
  • 在 9 层的架构空间中探索 1,166,400 种架构配置,以实现高可解释性与高性能的多样化模型配置。

实验结果

研究问题

  • RQ1能否通过生物学知识有效引导神经架构搜索,在不牺牲预测能力的前提下提升模型可解释性?
  • RQ2如何系统性地将现有实验知识(如来自 RNAcompete 的知识)整合到基因组学深度学习模型搜索中?
  • RQ3BioNAS 是否能通过利用 eCLIP 等体内数据,发现先前体外实验中不存在的新型生物学基序?
  • RQ4知识感知的架构搜索在多大程度上提升了第一层卷积滤波器的生物学可解释性?
  • RQ5该框架能否揭示标准训练方法所遗漏的生物学有意义序列模式(如剪接信号)?

主要发现

  • BioNAS 在 eCLIP 数据中成功发现了 U2AF2 3′-剪接位点模式 AG,该特征在体外 RNAcompete 数据中缺失,但对剪接保真度至关重要。
  • 针对 U2AF2、QKI、RBFOX2 和 RBM5 学习到的模型基序与已知 RNAcompete 基序高度相似,同时揭示了新的侧翼序列偏好。
  • 知识差异与验证损失在训练迭代过程中均持续下降,表明预测能力与知识一致性实现了有效联合优化。
  • BioNAS 最优模型在保持高预测性能的同时,生成了可解释的滤波器,可被标注为具有生物学功能。
  • 通过结合体内数据与先前的体外知识,该框架实现了对生物学相关模式(如剪接信号)的发现。
  • BioNAS 展现出其能力:在未整合知识感知架构搜索的情况下,这些新型调控基序将无法被发现。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。