[論文レビュー] PepDoRA: A Unified Peptide Language Model via Weight-Decomposed Low-Rank Adaptation
PepDoRAは、10万個の多様で実験的に検証されたペプチドを対象に、ChemBERTa-77M-MLMをWeight-Decomposed Low-Rank Adaptation (DoRA)で微調整する統合的ペプチド言語モデルであり、膜透過性、溶血性、非付着性、標的特異的結合といった治療的特性を高精度で予測可能である。一般向けおよびペプチド特化型のベースラインを上回る性能を示す。
Peptide therapeutics, including macrocycles, peptide inhibitors, and bioactive linear peptides, play a crucial role in therapeutic development due to their unique physicochemical properties. However, predicting these properties remains challenging. While structure-based models primarily focus on local interactions, language models are capable of capturing global therapeutic properties of both modified and linear peptides. Protein language models like ESM-2, though effective for natural peptides, cannot however encode chemical modifications. Conversely, pre-trained chemical language models excel in representing small molecule properties but are not optimized for peptides. To bridge this gap, we introduce PepDoRA, a unified peptide representation model. Leveraging Weight-Decomposed Low-Rank Adaptation (DoRA), PepDoRA efficiently fine-tunes the ChemBERTa-77M-MLM on a masked language model objective to generate optimized embeddings for downstream property prediction tasks involving both modified and unmodified peptides. By tuning on a diverse and experimentally valid set of 100,000 modified, bioactive, and binding peptides, we show that PepDoRA embeddings capture functional properties of input peptides, enabling the accurate prediction of membrane permeability, non-fouling and hemolysis propensity, and via contrastive learning, target protein-specific binding. Overall, by providing a unified representation for chemically and biologically diverse peptides, PepDoRA serves as a versatile tool for function and activity prediction, facilitating the development of peptide therapeutics across a broad spectrum of applications.
研究の動機と目的
- 自然および修飾ペプチドを効果的に表現できない既存モデルのギャップを埋める。特にシクロ化や非天然アミノ酸を含む複雑な修飾を持つペプチドに対応する。
- タンパク質言語モデル(例:ESM-2)や化学言語モデル(例:ChemBERTa)が、バイオアクティブペプチドの機能的および物理的性質を十分に捉えられていないという制限を克服する。
- 事前学習済みcLMの強固な化学的知識と、ペプチド特化タスクに効率的な微調整を統合する統合的表現フレームワークを開発する。
- 構造的データを必要とせず、膜透過性、溶血性、非付着性といった主要な治療的特性を正確に予測可能にする。
- 共同ペプチド-タンパク質埋め込み学習により、構造的多様性やドライガブルでないタンパク質を標的にするペプチド医薬の設計を促進する。
提案手法
- 重み分解型低ランク適応(DoRA)と呼ばれるパラメータ効率的微調整手法を用いて、事前学習済みのChemBERTa-77M-MLMモデルを微調整する。この手法は重み更新を低ランク行列に分解する。
- 10万個の多様で実験的に検証されたペプチドデータセット(修飾およびバイオアクティブな線形ペプチドを含む)を用い、マスクド言語モデルの目的関数で学習を実施する。
- DoRAを活用することで、ChemBERTaの事前学習済み化学的知識を保持しつつ、ペプチド特化の機能的性質に適応させる。
- CLIPにインspiredしたアーキテクチャを用いて対照的学習を実施し、真の結合ペアのコサイン類似度を最大化する共同ペプチド-タンパク質埋め込みを学習する。
- 得られたペプチド埋め込みを、膜透過性、溶血性、非付着性予測を含む、下流の回帰および分類タスクの入力特徴として使用する。
- 全微調整、LoRA、PeptideCLM、PeptideBERTなどのベースラインモデルと比較し、DoRAベースの適応の有効性を検証する。
実験結果
リサーチクエスチョン
- RQ1DoRAベースの微調整は、修飾およびバイオアクティブな配列を含む多様なペプチドの機能的および物理的性質を、化学言語モデル(ChemBERTa)が的確に捉えられるように効果的に適応可能か?
- RQ2PepDoRAは、膜透過性や溶血性といった主要な治療的特性を予測する際、PeptideBERT や PeptideCLM といった専用ペプチドモデルと比較して、どのように優れているか?
- RQ3PepDoRA埋め込みは、特に挑戦的または無秩序な構造を示す標的にも、標的特異的ペプチド-タンパク質結合をどれほど正確に予測可能にするか?
- RQ4PepDoRAが学習する統合的表現は、別々のモデルアーキテクチャを必要とせずに、自然および修飾ペプチドの両方に対して一般化可能か?
- RQ5PepDoRA埋め込みを用いた対照的学習フレームワークは、ゼロショットまたはフェイントショット設定において、真の結合ペアと非結合ペアを効果的に区別できるか?
主な発見
- 非付着性分類において、PepDoRAは87%の正確度、70%のF1スコア、71%の再現率を達成し、PeptideBERT(87%正確度、69%F1、67%再現率)を上回った。
- 溶血性予測において、PepDoRAは80%の正確度と37%のF1スコアを達成し、PeptideBERT(81%正確度、35%F1)をわずかに上回り、再現率(27% vs. 25%)も顕著に優れていた。
- ペプチド-タンパク質相互作用予測において、PepDoRAは95.9%のバイナリ正確度、62.1%のTop-1正確度、86.1%のTop 10%正確度を達成し、LoRA微調整済みChemBERTa(95.1%、60.0%、84.9%)を含むすべてのベースラインを上回った。
- PepDoRAの対照的学習による標的特異的結合予測性能は、ドライガブルでないか、構造的に柔軟な標的に対しても強く一般化可能であることが示された。
- DoRAベースの微調整戦略により、ChemBERTaの化学的知識が保持されつつ、ペプチド特化タスクへの高精度な適応が可能となり、全微調整のコストを回避できた。
- PepDoRAは、専用のPeptideCLM-23Mモデル(93.9%バイナリ正確度、47.3%Top-1正確度)をも上回り、ペプチドタイプにわたるより広範な適用可能性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。