[論文レビュー] Peptide-GPT: Generative Design of Peptides using Generative Pre-trained Transformers and Bio-informatic Supervision
Peptide-GPT は、バイオインフォマティクスのフィルタリングとディープラーニング分類器を用いて、特異的生物学的特性(溶血性、非溶血性、非ファウリング性、溶解性)を持つデ・ノボペプチドの生成を目的とした、微調整された ProtGPT2 モデルを導入する。溶血性予測で 76.26%、非溶血性で 72.46%、非ファウリング性で 78.84%、溶解性で 68.06% の精度を達成し、構造的・機能的妥当性を伴う NLP を用いたタンパク質設計の有効性を示している。
In recent years, natural language processing (NLP) models have demonstrated remarkable capabilities in various domains beyond traditional text generation. In this work, we introduce PeptideGPT, a protein language model tailored to generate protein sequences with distinct properties: hemolytic activity, solubility, and non-fouling characteristics. To facilitate a rigorous evaluation of these generated sequences, we established a comprehensive evaluation pipeline consisting of ideas from bioinformatics to retain valid proteins with ordered structures. First, we rank the generated sequences based on their perplexity scores, then we filter out those lying outside the permissible convex hull of proteins. Finally, we predict the structure using ESMFold and select the proteins with pLDDT values greater than 70 to ensure ordered structure. The properties of generated sequences are evaluated using task-specific classifiers - PeptideBERT and HAPPENN. We achieved an accuracy of 76.26% in hemolytic, 72.46% in non-hemolytic, 78.84% in non-fouling, and 68.06% in solubility protein generation. Our experimental results demonstrate the effectiveness of PeptideGPT in de novo protein design and underscore the potential of leveraging NLP-based approaches for paving the way for future innovations and breakthroughs in synthetic biology and bioinformatics. Codes, models, and data used in this study are freely available at: https://github.com/aayush-shah14/PeptideGPT.
研究の動機と目的
- 溶血性、溶解性、非ファウリング性といった特定の機能的特性を有するペプチドを設計するための生成的 AI モデルの開発。
- 生成された配列の構造的妥当性を保証するため、自己エントロピー順位付け、凸包フィルタリング、pLDDT に基づく構造予測を含むバイオインフォマティクスの検証手順の統合。
- タスク固有の分類器(PeptideBERT および HAPPENN)を用いて生成ペプチドの性能を評価し、機能的正確性を測定。
- 特に非ファウリングタンパク質に対して、既知のタンパク質空間の周縁部に位置する新しいペプチド配列の発見を可能にする。
- 再現可能性および合成生物学・バイオエンジニアリング分野における今後の開発を促進するため、モデル、コード、データをオープンソースで提供。
提案手法
- 実験的に検証済みのペプチドの4つの異なるデータセット(溶血性、非溶血性、非ファウリング性、溶解性タンパク質)を用いて、ProtGPT2 を微調整。
- 生成された配列の可能性と整合性を評価するため、自己エントロピースコアを用いて順位付け。
- 既知の有効なタンパク質配列の凸包を用いてフィルタリングを行い、生物学的に不適切または不安定な配列を除外。
- ESMFold を用いて3次元構造を予測し、pLDDT > 70 を満たすもののみを保持して、秩序立った安定した折りたたみを保証。
- 最終的な配列を PeptideBERT および HAPPENN を用いて分類し、タスク固有の正確性で機能的特性を評価。
- サンプリングパラメータ(最大長、top-k、繰り返しペナルティ)を用い、5つの異なるランダムシードを用いて各特性ごとに5,000配列を生成。
実験結果
リサーチクエスチョン
- RQ1微調整された生成的事前学習トランスフォーマーモデルは、溶血性や溶解性といった望ましい機能的特性を有する新しいペプチド配列を効果的に生成できるか?
- RQ2自己エントロピー、凸包、pLDDT を含むバイオインフォマティクスのフィルタリング統合は、生成ペプチドの構造的妥当性と生物学的妥当性を確保するのにどの程度有効か?
- RQ3生成ペプチドは、特に非ファウリング配列において、既知の機能的タンパク質の分布と、潜在空間でどの程度一致するか?
- RQ4モデルは、既知のタンパク質空間の周縁部に位置するペプチドを生成でき、新しい機能的モチーフの発見を可能にするか?
- RQ5PeptideBERT や HAPPENN といった専用分類器によって評価された場合、生成ペプチドの機能的正確性はどの程度か?
主な発見
- Peptide-GPT は、溶血性ペプチドを識別する際、76.26% の正確性を達成し、標的のリティック活性を有する配列の生成において優れた性能を示した。
- 非溶血性ペプチドの生成においては 72.46% の正確性を達成し、溶血性特性の効果的な抑制が可能であることを示した。
- 非ファウリングペプチド生成は、78.84% の最高正確性を達成し、非特異的結合を防ぐ表面特性を強く捉えていることを示唆した。
- 溶解性ペプチド生成は 68.06% の正確性を達成し、モデルが好ましい溶解性特性を持つ配列を生成する能力を示した。
- 非溶血性タスクでは、有効な配列のうち 44.46% が pLDDT > 70 を満たしており、折りたたみ構造の高い信頼性を示した。
- t-SNE 視覚化により、生成された非ファウリング配列が既知のタンパク質空間の境界に位置していることが示され、新しい機能的領域の探索がなされていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。