Skip to main content
QUICK REVIEW

[論文レビュー] ReLSO: A Transformer-based Model for Latent Space Optimization and Generation of Proteins

Egbert Castro, Abhinav Godavarthi|arXiv (Cornell University)|Jan 24, 2022
vaccines and immunoinformatics approaches被引用数 6
ひとこと要約

ReLSO は、タンパク質配列の共同生成とフィtness予測のための構造的・正則化された潜在空間を学習するトランスフォーマー基盤のオートエンコーダーである。潜在空間における勾配最適化を可能にすることで、ReLSO は、抗ランビズマブおよびGFPデータセットにおいて、ベースライン手法よりも高いフィtness最適化効率を達成し、より頑健な高フィtness配列を生成する。

ABSTRACT

The development of powerful natural language models have increased the ability to learn meaningful representations of protein sequences. In addition, advances in high-throughput mutagenesis, directed evolution, and next-generation sequencing have allowed for the accumulation of large amounts of labeled fitness data. Leveraging these two trends, we introduce Regularized Latent Space Optimization (ReLSO), a deep transformer-based autoencoder which features a highly structured latent space that is trained to jointly generate sequences as well as predict fitness. Through regularized prediction heads, ReLSO introduces a powerful protein sequence encoder and novel approach for efficient fitness landscape traversal. Using ReLSO, we explicitly model the sequence-function landscape of large labeled datasets and generate new molecules by optimizing within the latent space using gradient-based methods. We evaluate this approach on several publicly-available protein datasets, including variant sets of anti-ranibizumab and GFP. We observe a greater sequence optimization efficiency (increase in fitness per optimization step) by ReLSO compared to other approaches, where ReLSO more robustly generates high-fitness sequences. Furthermore, the attention-based relationships learned by the jointly-trained ReLSO models provides a potential avenue towards sequence-level fitness attribution information.

研究の動機と目的

  • 広大でエピスタティックなタンパク質配列空間を効率的に探索し、機能的タンパク質を設計する課題に対処する。
  • ハイプラフォルムスクリーニングから得られる大規模なラベル付きフィtnessデータを活用し、共同で配列とフィtnessをモデリングする深層生成モデルを訓練する。
  • 効率的な勾配最適化を可能にする、非常に構造的で滑らかで擬似凸性を持つ潜在空間を開発する。
  • 共同訓練されたフィtness予測ヘッドの勾配上昇法を用いて、潜在空間における直接的最適化を可能にし、ブラックボックスまたは逐次的手法よりも探索効率を向上させる。

提案手法

  • タンパク質配列を低次元で情報豊富な潜在空間にエンコードするトランスフォーマー基盤のオートエンコーダー・アーキテクチャを採用する。
  • 正則化されたフィtness予測ヘッドと共同で潜在表現を学習し、潜在コードから直接機能的特性を予測する。
  • 3つの主要な正則化を適用する: (1) フィtness予測損失による滑らかさ、(2) 潜在空間正則化による連続性および補間可能性、(3) 訓練データ外のネガティブサンプリングによる擬似凸性。
  • フィtness予測ヘッドの勾配を用いて潜在空間で勾配最適化を実行し、高フィtness領域への効率的な到達を可能にする。
  • ReLSO の性能を、インシリコ指向進化、MCMC、ハイルクライミング、および適応的スキャン(DbAS、CbAS)といった複数のベースラインと比較する。両方の空間(配列空間および潜在空間)で比較を行う。
  • 公平な比較のため、公開済みのDbASおよびCbASの実装を用い、ハイパーパramータチューニング(q ∈ [0.5, 0.8]、エポック数 ∈ [1, 15])を実施する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のオートエンコーダーにおいて、共同訓練された正則化された潜在空間は、標準的なブラックボックスまたは逐次的手法よりも、タンパク質配列最適化をより効率的に行えるか?
  • RQ2ReLSO の正則化された潜在空間は、フィtnessランドスケープの到達と高フィtnネス配列への収束をどの程度向上させるか?
  • RQ3勾配最適化を用いた潜在空間最適化は、MCMC やハイルクライミング、適応的スキャンといった勾配フリー手法と比較して、最適化ステップあたりのフィtnネス向上量において、どのように差を示すか?
  • RQ4ReLSO におけるアテンションメカニズムは、学習されたアテンションパターンを通じて、解釈可能な配列レベルのフィtnネス寄与度情報を提供するか?
  • RQ5ReLSO は、抗ランビズマブおよびGFPのような多様なタンパク質ファミリーに一般化可能であり、最小限のインシリコスクリーニングで高フィtnネス変異体を生成できるか?

主な発見

  • ReLSO は、抗ランビズマブおよびGFPデータセットの両方で、他の手法と比較して顕著に高いフィtnネス最適化効率を達成しており、最適化ステップあたりのフィtnネス上昇量が顕著に高い。
  • ReLSO モデルは高フィtnネス配列の生成において頑健であり、勾配最適化による潜在空間最適化(ReLSO-GA)は、勾配フリー手法およびブラックボックス適応的スキャン手法を上回る性能を示す。
  • 共同学習で得られたアテンションベースの関係性は、単なる予測を越えた解釈可能性を提供する可能性を秘めており、配列レベルのフィtnネス寄与度の可視化に役立つ。
  • 正則化された潜在空間は滑らかで連続的かつ補間可能であり、安定的かつ効果的な勾配上昇を可能にし、局所最適解へのリスクを低減する。
  • ReLSO は、特に初期最適化段階で、DbAS や CbAS といった最先端手法を上回る性能を発揮しており、これは潜在空間に構造的およびフィtnネスのインダクティブバイアスが統合されているためである。
  • ネガティブサンプリングと補間正則化の活用により、潜在空間の擬似凸性が向上し、最適化の安定性と収束性が向上している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。