Skip to main content
QUICK REVIEW

[论文解读] Fast differentiable DNA and protein sequence optimization for molecular design

Johannes Linder, Georg Seelig|arXiv (Cornell University)|May 22, 2020
RNA and protein synthesis mechanisms参考文献 42被引用 17
一句话总结

本文提出 Fast SeqProp,一种用于 DNA 和蛋白质序列设计的可微分优化方法,通过归一化核苷酸 logit 并在直通梯度近似中使用自适应熵,提升了收敛速度和适应度最优值。该方法相比以往的激活最大化方法,收敛速度最快可提升 100 倍,同时在多种生物任务中生成更高适应度的序列,包括增强子、5'UTR 和蛋白质结构设计。

ABSTRACT

Designing DNA and protein sequences with improved function has the potential to greatly accelerate synthetic biology. Machine learning models that accurately predict biological fitness from sequence are becoming a powerful tool for molecular design. Activation maximization offers a simple design strategy for differentiable models: one-hot coded sequences are first approximated by a continuous representation which is then iteratively optimized with respect to the predictor oracle by gradient ascent. While elegant, this method suffers from vanishing gradients and may cause predictor pathologies leading to poor convergence. Here, we build on a previously proposed straight-through approximation method to optimize through discrete sequence samples. By normalizing nucleotide logits across positions and introducing an adaptive entropy variable, we remove bottlenecks arising from overly large or skewed sampling parameters. The resulting algorithm, which we call Fast SeqProp, achieves up to 100-fold faster convergence compared to previous versions of activation maximization and finds improved fitness optima for many applications. We demonstrate Fast SeqProp by designing DNA and protein sequences for six deep learning predictors, including a protein structure predictor.

研究动机与目标

  • 解决现有用于离散生物序列的激活最大化方法中存在的收敛缓慢和适应度最优值差的问题。
  • 通过改进离散样本中的梯度流动,克服可微分序列优化中的梯度消失和预测器病态问题。
  • 开发一种无需模型和参数的方法,无需训练独立的生成模型,从而实现小序列集的快速设计。
  • 实现正则化技术(如基于 VAE 的先验和不确定性感知预测器)的集成,以生成更具生物学合理性的设计。
  • 在序列设计质量和效率方面,超越基于启发式方法(如模拟退火)和现代基于生成模型的方法。

提出的方法

  • Fast SeqProp 使用直通梯度近似来优化离散序列样本,使反向传播能够通过 one-hot 编码序列进行。
  • 通过在序列位置上对核苷酸 logit 进行归一化,稳定训练过程并防止采样分布的偏差。
  • 引入自适应熵变量,以动态调整采样温度,避免预测过于自信或信息不足的标记。
  • 该方法在 one-hot 序列的连续松弛上执行梯度上升,同时在最终序列生成中保持离散采样。
  • 通过 VAE 先验和概率预测模型中的不确定性估计实现正则化,以维持设计置信度和生物学相关性。
  • 该算法可直接应用于预训练的可微分预测器,无需重新训练或使用辅助生成模型。

实验结果

研究问题

  • RQ1可微分序列优化方法是否能显著快于现有激活最大化方法?
  • RQ2对 logit 进行归一化并引入自适应熵是否能提升优化序列的质量并防止梯度病态?
  • RQ3Fast SeqProp 是否能在序列设计任务中超越基于启发式搜索的方法和现代基于生成模型的方法?
  • RQ4Fast SeqProp 在多大程度上可整合正则化和不确定性估计,以生成更具生物学合理性的序列?
  • RQ5Fast SeqProp 在包括 DNA 调控元件和蛋白质结构在内的多种生物序列设计任务中是否均有效?

主要发现

  • Fast SeqProp 在 DNA 和蛋白质序列设计任务中,相比以往的激活最大化方法,收敛速度最快可提升 100 倍。
  • 该方法在六个不同的设计任务中,发现的序列预测适应度显著高于基线激活最大化方法和其他优化基线。
  • Fast SeqProp 在最终设计的速度和适应度方面,均优于全局搜索启发式方法(如模拟退火)和基于采样的方法(如 CbAS、FB-GAN 和 FB-VAE)。
  • 通过未参与优化的 oracle 模型进行独立验证,确认了 Fast SeqProp 生成序列的高适应度,证明了其鲁棒性和泛化能力。
  • 该方法成功设计出具有功能性的 DNA 元件(如增强子、5'UTR、多聚A信号)和预测结构与功能更优的蛋白质序列。
  • 通过正则化集成 VAE 先验和不确定性感知预测器,提升了设计置信度和生物学合理性,且未牺牲适应度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。