Skip to main content
QUICK REVIEW

[論文レビュー] TERMinator: A Neural Framework for Structure-Based Protein Design using Tertiary Repeating Motifs

Alex J. Li, Vikram Sundar|arXiv (Cornell University)|Apr 27, 2022
Machine Learning in Bioinformatics被引用数 7
ひとこと要約

TERMinator は、三次元反復モチーフ(TERMs)と骨格座標特徴をグラフニューラルネットワークに統合することで、構造ベースのタンパク質設計を向上させる、革新的なディープラーニングフレームワークである。統計的 TERM ベースの系列-構造関係と幾何的座標データを組み合わせることで、TERMinator はネイティブな配列回復において最先端の性能を達成し、TERM 特徴が最適な性能を発揮するために不可欠であることを示している。

ABSTRACT

Computational protein design has the potential to deliver novel molecular structures, binders, and catalysts for myriad applications. Recent neural graph-based models that use backbone coordinate-derived features show exceptional performance on native sequence recovery tasks and are promising frameworks for design. A statistical framework for modeling protein sequence landscapes using Tertiary Motifs (TERMs), compact units of recurring structure in proteins, has also demonstrated good performance on protein design tasks. In this work, we investigate the use of TERM-derived data as features in neural protein design frameworks. Our graph-based architecture, TERMinator, incorporates TERM-based and coordinate-based information and outputs a Potts model over sequence space. TERMinator outperforms state-of-the-art models on native sequence recovery tasks, suggesting that utilizing TERM-based and coordinate-based features together is beneficial for protein design.

研究の動機と目的

  • 三次元反復モチーフ(TERMs)と座標ベースの特徴を統合することで、構造ベースのタンパク質設計を向上させるニューラルフレームワークの開発。
  • 座標ベースのモデルに加えて、TERM 衍生の統計的特徴がタンパク質設計の性能を向上させるかどうかの調査。
  • 統合されたディープラーニングアーキテクチャにおいて、TERM ベースの特徴と座標ベースの特徴の寄与度を評価すること。
  • ハイブリッド構造的特徴抽出を用いた、スケーラブルでエンドツーエンドのタンパク質配列設計フレームワークの確立。

提案手法

  • TERMinator は二段階のアーキテクチャを採用:局所的 TERM グラフをメッセージパッシングネットワーク(TERM MPNN)で処理する TERM 情報圧縮器と、k-近傍(k-NN)グラフを介してグローバル構造を統合する GNN ポッツモデルエンコーダ。
  • TERM 特徴は、各 TERM ごとに上位 50 個の PDB マッチから得られ、リジッドな埋め込みはマッチ間のアテンションベースのプーリングにより生成され、エッジ埋め込みは重み付き交共分散行列により計算される。
  • TERM ベースの構造埋め込みと座標ベースの特徴(Ingraham らのもの)を統合し、系列空間上のポッツモデルを予測することで、アミノ酸の同一性を確率的スコアリング可能にする。
  • トレーニング中は合成疑似尤度損失を最小化し、ポッツモデルの自己相互作用項とペア相互作用項からエネルギーを計算して、文脈的アミノ酸ペアの評価を行う。
  • 推論には MCMC シミュレーテッドアニーリングを用い、学習されたポッツモデルから最適な配列を生成する。
  • アブレーションスタディーでは、TERM 特徴、座標特徴、GNN コンponent の寄与を分離し、個別および統合的な影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1三次元反復モチーフ(TERM)ベースの統計的特徴と剛体的な座標ベースの特徴を組み合わせることで、タンパク質配列設計の性能が向上するか?
  • RQ2座標ベースの特徴のみと比較して、TERM 衍生の特徴は系列-構造関係モデリングにどのように寄与するか?
  • RQ3TERM 統合による性能向上は、多様なタンパク質にわたる曖昧で繰り返し現れる構造的パターンを捉える能力に起因するのか?
  • RQ4GNN ポッツモデルエンコーダーは、TERM 特徴と座標特徴をどのように統合し、ネイティブな配列回復において既存のモデルを上回る性能を発揮するのか?

主な発見

  • TERMinator は CATH 4.2 ベンチマークデータセットにおいて、ネイティブな配列回復タスクで最先端のモデルを上回り、最高の性能を達成した。
  • アブレーションスタディーにより、TERM ベースの特徴が最適な性能を発揮するために不可欠であることが確認され、それらを除去すると顕著な性能低下が生じた。
  • 1 枚の V100 GPU 上で、1 構造あたり平均 97 ms(1 残基あたり 61 μs)の推論時間を達成しており、効率的なデプロイメントの可能性を示している。
  • GNN ポッツモデルエンコーダを搭載しないアブレート版の TERMinator は、dTERMen と同等の性能を示し、両者の特徴セットが本質的に類似していることを裏付けた。
  • TERM 特徴と座標特徴の統合により、合成疑似尤度のトレーニング目的関数が改善され、より強固で正確なポッツモデルが得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。