Skip to main content
QUICK REVIEW

[論文レビュー] Retrieval-Enhanced Mutation Mastery: Augmenting Zero-Shot Prediction of Protein Language Model

Yang Tan, Ruilin Wang|arXiv (Cornell University)|Oct 28, 2024
Topic Modeling被引用数 4
ひとこと要約

本稿では、分離されたクロスアテンションと相同配列の検索を用いて、配列、局所的構造、進化的情報の統合により、ゼロショットの突然変異効果予測を向上させる、リtrieval強化型のタンパク質言語モデルであるProtREMを提案する。ProteinGymの217のアッセイにおいて200万以上の突然変異に対して最先端の性能を達成し、DNAポリメラーゼおよびVHH抗体突然変異のインシリコおよびウェットラボでの妥当性評価にも成功した。

ABSTRACT

Enzyme engineering enables the modification of wild-type proteins to meet industrial and research demands by enhancing catalytic activity, stability, binding affinities, and other properties. The emergence of deep learning methods for protein modeling has demonstrated superior results at lower costs compared to traditional approaches such as directed evolution and rational design. In mutation effect prediction, the key to pre-training deep learning models lies in accurately interpreting the complex relationships among protein sequence, structure, and function. This study introduces a retrieval-enhanced protein language model for comprehensive analysis of native properties from sequence and local structural interactions, as well as evolutionary properties from retrieved homologous sequences. The state-of-the-art performance of the proposed ProtREM is validated on over 2 million mutants across 217 assays from an open benchmark (ProteinGym). We also conducted post-hoc analyses of the model's ability to improve the stability and binding affinity of a VHH antibody. Additionally, we designed 10 new mutants on a DNA polymerase and conducted wet-lab experiments to evaluate their enhanced activity at higher temperatures. Both in silico and experimental evaluations confirmed that our method provides reliable predictions of mutation effects, offering an auxiliary tool for biologists aiming to evolve existing enzymes. The implementation is publicly available at https://github.com/tyang816/ProtREM.

研究の動機と目的

  • 既存のタンパク質言語モデルが、突然変異効果予測のための配列、構造、進化的情報を統合できないというギャップを埋める。
  • 低スループットの実験的設定における単一およびマルチサイトのタンパク質突然変異のゼロショット予測の信頼性を向上させる。
  • 取得した相同配列を活用して進化的表現を強化し、予測された3次元構造の不正確さを軽減する統合フレームワークを開発する。
  • 高スループットのベンチマーク評価と機能酵素に対する標的的なウェットラボ実験を通じて、モデルの予測能力を妥当性評価する。
  • 生物学者が最小限の実験コストで機能的に改善されたタンパク質バリアントを設計できるように、公開可能なツールを提供する。

提案手法

  • ProtREMは、タンパク質配列と局所的3次元構造的特徴を、それぞれシーケンストークンと構造トークンに符号化し、局所的構造を2048種類の異なる構造トークンにクラスタリングする。
  • 分離されたマルチヘッドクロスアテンション層が、BERT風の事前学習パラダイムに基づき、シーケンスと構造表現を統合する。
  • 相同配列はJackhmmerを用いて検索され、アラインメントベースのトークン化により進化的ログィットに変換される。
  • モデルは構造的、シーケンシャル、進化的表現を統合し、各アミノ酸突然変異のフィットネススコアを生成する。
  • 事前学習は、シーケンス、構造、進化的信号の共同最適化を伴い、全長タンパク質配列におけるマスキング言語モデルの目的関数を用いて実施される。
  • モデルはProteinGymの高スループットDMSデータ上で微調整され、ベンチマークおよび低スループットの実験データセット上で評価される。

実験結果

リサーチクエスチョン

  • RQ1大規模なDMSデータを用いて、多様なタンパク質およびアッセイにおいて、ProtREMが既存のモデルを一貫して上回る突然変異効果予測性能を示すか?
  • RQ2正確な機能的測定が可能な低スループットの実験的設定において、ProtREMの一般化性能はどの程度高いか?
  • RQ3ProtREMは、実世界の酵素工学の応用において、機能的に改善された突然変異体の設計をどの程度効果的に支援できるか?
  • RQ4予測された3次元構造に依存するモデルと比較して、取得した相同配列の統合が予測の信頼性をどの程度向上させるか?
  • RQ5ProtREMは、耐熱性や活性が向上したことが実験的に妥当性評価された、新たな高性能な突然変異体を特定できるか?

主な発見

  • ProtREMはProteinGymベンチマークで最先端の性能を達成し、217のアッセイおよび200万以上の突然変異において、先行手法を上回るスピアマンのρを示した。
  • 低スループットの実験データにおいても、高い予測信頼性を示し、安定性および結合親和性の向上が見込まれるVHH抗体の有益な突然変異を効果的に同定した。
  • phi29 DNAポリメラーゼにおける10個の設計突然変異体のウェットラボ妥当性評価により、耐熱性が向上したことが確認され、差示走査走査分光法によるTm値の上昇が測定された。
  • 取得した相同配列の統合により、進化的表現が顕著に向上し、誤った予測された3次元構造に依存する必要が軽減された。
  • 後処理解析の結果、ProtREMは保存領域や突然変異不能領域を効果的に同定し、機能的に関連する突然変異を優先的に特定していることが示された。
  • 実装はhttps://github.com/tyang816/ProtREMにて公開されており、再現性とコミュニティの採用を可能にしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。