Skip to main content
QUICK REVIEW

[論文レビュー] Fast differentiable DNA and protein sequence optimization for molecular design

Johannes Linder, Georg Seelig|arXiv (Cornell University)|May 22, 2020
RNA and protein synthesis mechanisms参考文献 42被引用数 17
ひとこと要約

この論文では、核酸のログ確率を正規化し、ストレートスラッジ勾配近似に適応的エントロピーを導入することで、収束速度とフィットネス最適解を向上させる微分可能最適化手法である Fast SeqProp を提案する。従来の活性化最大化手法と比較して、100倍速い収束を達成するとともに、エンハンサー、5'UTR、タンパク質構造設計を含む複数の生物学的タスクで高いフィットネスを持つ配列を生成する。

ABSTRACT

Designing DNA and protein sequences with improved function has the potential to greatly accelerate synthetic biology. Machine learning models that accurately predict biological fitness from sequence are becoming a powerful tool for molecular design. Activation maximization offers a simple design strategy for differentiable models: one-hot coded sequences are first approximated by a continuous representation which is then iteratively optimized with respect to the predictor oracle by gradient ascent. While elegant, this method suffers from vanishing gradients and may cause predictor pathologies leading to poor convergence. Here, we build on a previously proposed straight-through approximation method to optimize through discrete sequence samples. By normalizing nucleotide logits across positions and introducing an adaptive entropy variable, we remove bottlenecks arising from overly large or skewed sampling parameters. The resulting algorithm, which we call Fast SeqProp, achieves up to 100-fold faster convergence compared to previous versions of activation maximization and finds improved fitness optima for many applications. We demonstrate Fast SeqProp by designing DNA and protein sequences for six deep learning predictors, including a protein structure predictor.

研究の動機と目的

  • 離散的な生物学的配列に対する既存の活性化最大化手法の収束が遅く、フィットネス最適解が得られにくい問題に対処すること。
  • 離散的サンプルを通した勾配の流れを改善することで、微分可能シーケンス最適化における勾配消失や予測子の病理的挙動を克服すること。
  • 別個の生成モデルを訓練する必要がない、モデルおよびパrameterフリーな手法を開発し、小規模なシーケンス集合の迅速な設計を可能にすること。
  • VAEベースの事前分布や不確実性を考慮した予測子を用いた正則化技術を組み込むことで、生物学的に妥当な設計を可能にすること。
  • ヒューリスティック手法(例:シミュレーテッドアニーリング)と最新の生成モデルベースの手法を凌駕する、シーケンス設計の質と効率性を実現すること。

提案手法

  • Fast SeqProp はストレートスラッジ勾配近似を用いて離散的シーケンスサンプルを最適化し、ワンホットエンコードされたシーケンスを介したバックプロパゲーションを可能にする。
  • シーケンス位置に跨るヌクレオチドログ確率を正規化することで、トレーニングの安定化と歪んだサンプリング分布の防止を図る。
  • 動的サンプリング温度を調整するための適応的エントロピー変数を導入し、過度に自信を持つか、情報が乏しいトークン予測を防ぐ。
  • 連続的リラクゼーションを用いた勾配上昇法を実行するが、最終的なシーケンス生成には離散的サンプリングを維持する。
  • VAE事前分布と確率的予測子モデルにおける不確実性推定を正則化に活用することで、設計の信頼性と生物学的妥当性を維持する。
  • 再トレーニングや補助的生成モデルを必要とせず、事前学習済みの微分可能予測子に直接適用可能である。

実験結果

リサーチクエスチョン

  • RQ1微分可能シーケンス最適化手法として、既存の活性化最大化手法と比較して著しく速い収束を達成できるか?
  • RQ2ログ確率の正規化と適応的エントロピーの導入が、最適化されたシーケンスの品質を向上させ、勾配の病理的挙動を防止できるか?
  • RQ3Fast SeqProp は、ヒューリスティック探索手法と最新の生成モデルベース手法を凌駕するシーケンス設計タスクの性能を示せるか?
  • RQ4Fast SeqProp が正則化と不確実性推定をどれほど組み込むことで、生物学的に妥当なシーケンスを生成できるか?
  • RQ5Fast SeqProp は、DNA レギュラトリーエレメントやタンパク質構造を含む多様な生物学的シーケンス設計タスクに有効であるか?

主な発見

  • Fast SeqProp は、DNA やタンパク質配列設計タスクにおいて、従来の活性化最大化手法と比較して最大で 100 倍の高速な収束を達成した。
  • 6 つの異なる設計タスクにおいて、ベースラインの活性化最大化手法や他の最適化ベースラインと比較して、顕著に高い予測フィットネスを持つ配列を発見した。
  • シミュレーテッドアニーリングなどのグローバル探索ヒューリスティックと、CbAS や FB-GAN、FB-VAE などのサンプリングベース手法を、両方の面で上回った。
  • 最適化に参加しなかったオラクルモデルによる独立した検証により、Fast SeqProp が生成した配列の高フィットネスが確認され、ロバストネスと一般化性能が裏付けられた。
  • Fast SeqProp は、機能的 DNA 要素(エンハンサー、5'UTR、ポリAシグナル)および予測構造・機能が向上したタンパク質配列の設計に成功した。
  • VAE事前分布と不確実性を考慮した予測子を正則化に組み込むことで、フィットネスを損なうことなく、設計の信頼性と生物学的妥当性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。