Skip to main content
QUICK REVIEW

[論文レビュー] TaxDiff: Taxonomic-Guided Diffusion Model for Protein Sequence Generation

Lin Zongying, Hao Li|arXiv (Cornell University)|Feb 27, 2024
Microbial Metabolic Engineering and Bioproduction被引用数 4
ひとこと要約

TaxDiffは、タンパク質配列の制御可能な生成を可能にする新規の拡散モデルであり、各Transformerブロックに分類情報(系統分類)を統合することで、構造的に安定したタンパク質の生成を支援する。パッチ化機構を用いてグローバルおよびローカルのアテンションを組み合わせることで、非条件的および系統分類ガイドド生成の両方で最先端の性能を達成し、構造的指標において先行モデルを上回り、推論時間をベースラインの拡散モデルの25%にまで短縮した。

ABSTRACT

Designing protein sequences with specific biological functions and structural stability is crucial in biology and chemistry. Generative models already demonstrated their capabilities for reliable protein design. However, previous models are limited to the unconditional generation of protein sequences and lack the controllable generation ability that is vital to biological tasks. In this work, we propose TaxDiff, a taxonomic-guided diffusion model for controllable protein sequence generation that combines biological species information with the generative capabilities of diffusion models to generate structurally stable proteins within the sequence space. Specifically, taxonomic control information is inserted into each layer of the transformer block to achieve fine-grained control. The combination of global and local attention ensures the sequence consistency and structural foldability of taxonomic-specific proteins. Extensive experiments demonstrate that TaxDiff can consistently achieve better performance on multiple protein sequence generation benchmarks in both taxonomic-guided controllable generation and unconditional generation. Remarkably, the sequences generated by TaxDiff even surpass those produced by direct-structure-generation models in terms of confidence based on predicted structures and require only a quarter of the time of models based on the diffusion model. The code for generating proteins and training new versions of TaxDiff is available at:https://github.com/Linzy19/TaxDiff.

研究の動機と目的

  • 生物的応用における非条件的タンパク質配列生成の限界、すなわちランダムな生成に多大なフィルタリング作業を要することを是正すること。
  • 生物学的系統分類を条件信号として組み込むことで、細かく制御可能なタンパク質設計を可能にすること。
  • ハイブリッドアテンション機構を用いて、生成されたタンパク質配列の構造的一致性とモデリング精度を向上させること。
  • 既存の拡散ベースのタンパク質生成モデルと比較して、性能を維持または向上させつつ推論時間を短縮すること。

提案手法

  • ノイズ除去Transformerブロックの各層に系統分類制御特徴を統合し、種や系統分類に基づく条件付き生成を可能にする。
  • 全配列に対するグローバルアテンションと固定サイズのアミノ酸パッチ(例:16アミノ酸)に対するローカルアテンションを組み合わせるパッチ化アテンション機構を提案する。
  • UniProt分類が多すぎることによる問題を解消するため、家族レベルおよび種レベルでタンパク質配列を再分類することで、トレーニングの安定性と制御の正確性を向上させる。
  • EvoDiffに類似した拡散ベースの生成フレームワークを採用し、共有潜在空間内で配列と構造を同時に生成可能にする。
  • 非条件的および条件付き生成の両方で共通のアーキテクチャを採用することで、異なる生物学的設計タスクへのシームレスな適応を可能にする。
  • 構造予測と評価にOmegaFoldを採用し、pLDDT、TMスコア、RMSD、Fidentを主な指標として、生成された配列の品質を評価する。

実験結果

リサーチクエスチョン

  • RQ1系統分類情報は、生物学的に妥当なタンパク質配列の条件付き生成に効果的に利用可能か?
  • RQ2グローバルおよびローカルアテンション機構の組み合わせは、生成タンパク質の構造的および配列レベルの品質にどのように影響するか?
  • RQ3パッチ化アテンション機構は、標準的な自己アテンションと比較して、生成効率および構造的一致性をどの程度向上させるか?
  • RQ4TaxDiffは、非条件的および系統分類ガイドド生成の両方において、最先端のモデルと比較してどの程度優れているか?
  • RQ5既存の拡散ベースのモデルと比較して、TaxDiffはより高い構造的信頼性と短い推論時間を有するタンパク質配列を生成できるか?

主な発見

  • 非条件的タンパク質配列生成において、TaxDiffはベースラインモデルと比較してFidentスコアで7.13%、TMスコアで11.93%の向上を達成し、構造ベースのモデルでさえも上回った。
  • 系統分類ガイドド生成において、TaxDiffのpLDDTスコアは他のシーケンスモデルよりも顕著に高く、天然タンパク質のスコアに近づいた。これは高い構造的信頼性を示している。
  • 1,000個のタンパク質配列を生成するのにわずか24分で完了したが、これは他の拡散ベースのモデルと比較して1/4~2/3の時間であり、優れた推論効率を示している。
  • グローバルおよびローカルアテンションの組み合わせ(メソッドA)が全指標で最良のパフォーマンスを発揮した。ローカルアテンションのみ(メソッドE)も、標準的なアテンション設定を上回った。
  • 16アミノ酸のパッチに分割すると、TMスコアやRMSDといった構造的指標で最適な結果が得られた。一方、64アミノ酸のパッチはFidentなどの配列レベル指標で優れた結果を示した。
  • 実験的結果から、タンパク質配列においてローカルアテンションは全配列アテンションよりも効果的であることが確認された。これは、言語における「短い文」に類似した固有の局所的構造的パターンが存在することを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。