Skip to main content
QUICK REVIEW

[論文レビュー] ProLLM: Protein Chain-of-Thoughts Enhanced LLM for Protein-Protein Interaction Prediction

Mingyu Jin, Haochen Xue|arXiv (Cornell University)|Mar 30, 2024
Bioinformatics and Genomic Networks被引用数 4
ひとこと要約

本論文では、生物学的シグナル伝達経路を自然言語推論チェーンとしてモデル化することで、直接的な物理的結合にとどまらず、間接的で複数ステップにわたるタンパク質相互作用を予測するため、Protein Chain-of-Thought (ProCoT) プロンプトを組み込んだ大規模言語モデルフレームワークであるProLLMを提案する。ProCoTにより、従来の手法よりも予測精度と一般化性能が顕著に向上し、ベンチマークデータセット上での性能が著しく向上した。

ABSTRACT

The prediction of protein-protein interactions (PPIs) is crucial for understanding biological functions and diseases. Previous machine learning approaches to PPI prediction mainly focus on direct physical interactions, ignoring the broader context of nonphysical connections through intermediate proteins, thus limiting their effectiveness. The emergence of Large Language Models (LLMs) provides a new opportunity for addressing this complex biological challenge. By transforming structured data into natural language prompts, we can map the relationships between proteins into texts. This approach allows LLMs to identify indirect connections between proteins, tracing the path from upstream to downstream. Therefore, we propose a novel framework ProLLM that employs an LLM tailored for PPI for the first time. Specifically, we propose Protein Chain of Thought (ProCoT), which replicates the biological mechanism of signaling pathways as natural language prompts. ProCoT considers a signaling pathway as a protein reasoning process, which starts from upstream proteins and passes through several intermediate proteins to transmit biological signals to downstream proteins. Thus, we can use ProCoT to predict the interaction between upstream proteins and downstream proteins. The training of ProLLM employs the ProCoT format, which enhances the model's understanding of complex biological problems. In addition to ProCoT, this paper also contributes to the exploration of embedding replacement of protein sites in natural language prompts, and instruction fine-tuning in protein knowledge datasets. We demonstrate the efficacy of ProLLM through rigorous validation against benchmark datasets, showing significant improvement over existing methods in terms of prediction accuracy and generalizability. The code is available at: https://github.com/MingyuJ666/ProLLM.

研究の動機と目的

  • 従来のPPI予測手法が直接的な物理的相互作用に限定されており、経路に基づく間接的相互作用を無視するという限界に対処すること。
  • 大規模言語モデル(LLMs)を活用し、タンパク質シグナル伝達経路を自然言語推論チェーンとしてモデル化する画期的なフレームワークの開発。
  • 生物学的知識データセットにおける指示微調整とタンパク質固有の埋め込みを統合することで、PPI予測性能の向上。
  • 従来のモデルが見逃す累積的で複数ステップにわたるタンパク質相互作用を、ProCoTがどのように捉えられるかを評価。
  • 適切に生物学的に意味のある推論構造でプロンプトされたLLMが、グラフニューラルネットワークやCNNベースのモデルを上回ることを示すこと。

提案手法

  • ProCoT(タンパク質チェーン・オブ・オブザイト)は、上流から下流のタンパク質にかけての段階的推論シーケンスとして、シグナル伝達経路を自然言語プロンプト形式で表現するものである。
  • フレームワークはタンパク質相互作用データを、生物学的シグナル伝達の順序的論理を符号化した構造化された自然言語プロンプトに変換する。
  • タンパク質固有の埋め込みをProtTransから統合し、シーケンスレベルの生物学的情報を保持する。
  • 生物学的知識データセットを用いた指示微調整により、モデルのPPIに関する推論能力を強化する。
  • 性能と安定性を評価するため、複数のLLMバックボーン(Flan-T5-base, Flan-T5-large, Flan-T5-XL, LLaMA-v1-7b)を評価した。
  • アブレーションスタディにより、ProCoT、埋め込み置換、指示微調整の各要素の貢献度を分離し、予測性能への影響を定量化した。

実験結果

リサーチクエスチョン

  • RQ1タンパク質シグナル伝達経路を自然言語推論チェーン(ProCoT)としてモデル化することで、直接相互作用の検出を越えてPPI予測性能が向上するか?
  • RQ2タンパク質固有の埋め込みと指示微調整の統合が、多様なPPIデータセットにわたるモデルの一般化能力に与える影響は何か?
  • RQ3埋め込み置換や指示微調整と比較して、ProCoTの相対的寄与度は、モデル性能向上にどの程度寄与しているか?
  • RQ4チェーン・オブ・オブザイトプロンプトを用いたLLMは、従来のGNNやCNNベースの手法を上回るPPI予測性能を示すか?
  • RQ5複数のベンチマークデータセット(サイズや生物学的文脈が異なる)において、ProLLMフレームワークはどの程度安定的かつ一般化可能か?

主な発見

  • Flan-T5-largeバックボーンを搭載したProLLMは、STRINGデータセットで最高のマイクロ-F1スコア87.12 ± 1.68を達成し、他のすべてのモデルおよびベースラインを上回った。
  • ProCoTプロンプト形式そのものが顕著な性能向上をもたらし、すべてのコンポONENTを組み合わせた際のマイクロ-F1は、ProCoTなしの78.32 ± 2.65から91.03 ± 1.63に上昇した。
  • アブレーションスタディにより、ProCoTが性能向上に最も大きな影響を与えることが確認され、ベースラインからProCoTなしの状態と比較して、Humanデータセットでマイクロ-F1が12.7ポイント向上した。
  • Flan-T5-largeが最も優れた全体的な性能を示し、より大きなモデルであるLLaMA-v1-7bよりも優れていたが、その分高い不安定性と低い正確性を示した。
  • 指示微調整と埋め込み置換は肯定的な寄与を示したが、ProCoTに比べて影響度は小さく、推論構造が性能向上の主因であることが示された。
  • モデルは優れた一般化性能を示し、Human, SHS27K, SHS148K, STRINGの4つのベンチマークデータセットすべてで高いマイクロ-F1スコアを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。