Skip to main content
QUICK REVIEW

[論文レビュー] Preference optimization of protein language models as a multi-objective binder design paradigm

Pouria Mistani, Venkatesh Mysore|arXiv (Cornell University)|Mar 7, 2024
Biomedical Text Mining and OntologiesBiochemistry, Genetics and Molecular Biology被引用数 3
ひとこと要約

本論文は、自己回帰的タンパク質言語モデル(pLM)上で直接的好み最適化(DPO)を用いて、結合親和性と望ましい物理的・化学的性質を向上させたペプチドバインダーを生成する、マルチオブジェクティブなバインダー設計フレームワークを紹介する。熟練者がアノテートした好ましいおよび好ましくない配列の選好データセットを用いてProtGPT2を微調整することで、等電点(pI)が17%〜60%の中央値改善が達成され、モデルが熟練者の設計基準に適切に整合する一方で、配列の混乱度(perplexity)が低下しないことが示された。

ABSTRACT

We present a multi-objective binder design paradigm based on instruction fine-tuning and direct preference optimization (DPO) of autoregressive protein language models (pLMs). Multiple design objectives are encoded in the language model through direct optimization on expert curated preference sequence datasets comprising preferred and dispreferred distributions. We show the proposed alignment strategy enables ProtGPT2 to effectively design binders conditioned on specified receptors and a drug developability criterion. Generated binder samples demonstrate median isoelectric point (pI) improvements by $17\%-60\%$.

研究の動機と目的

  • 言語モデルを用いて、結合親和性を越える複数の薬剤開発の目的を統合する計算フレームワークの開発を目的とする。
  • 既存の手法が生成段階で同時に物理的・化学的および開発可能性の制約を組み込まず、後から結合親和性のみを最適化するというギャップを埋める。
  • 熟練者がキュレートした選好データ(好ましい対比して好ましくない配列)をDPOを介してpLMに直接統合し、下流の回帰モデルや分類器に依存することを回避する。
  • 合成可能性や発現失敗といった、数量的でない複雑な基準を、選好信号としてエンコードすることで、治療的有用なリード化合物を生成する可能性を高める。
  • DPOが、配列品質と結合可能性を維持したまま、向上した等電点(pI)を持つバインダーを生成するようにpLMを効果的に整合させられることを示すこと。

提案手法

  • 2段階のトレーニングパイプラインを用いる:まず、OpenAIのchatMLフォーマットを用いて、受容体-バインダーの指示テンプレートに基づき、ProtGPT2を教師あり微調整(SFT)する。これにより、条件付き生成が可能になる。
  • 次に、ペaired選好データ(好ましいバインダー(高pI)と好ましくないバインダー(低pI))を用いて、SFTモデルを直接的好み最適化(DPO)で微調整する。好ましくないバインダーには、遠くのタンパク質由来のデコイ、または真のバインダーの変異形も含む。
  • 選好データセットは、各真のバインダーに対して複数の好ましくないデコイをペアリングし、合計66,898のトレーニングトリプレット(タンパク質、バインダー、デコイ)を構築。うち3,345はテスト用に保持。
  • DPOの目的関数は、好ましいと好ましくない配列間の報酬マージンを最大化するとともに、SFTモデルからのKLダイバージェンスを制約することで、モデルの高品質な配列生成能力を損なわずに整合性を実現する。
  • 混乱度、pI、および真のバインダーとの整合性スコアを評価するため、ビームサーチ、トップ-k、グリーディサンプリングを用いて配列生成を実施。
  • DPO損失、報酬マージン、正解率、混乱度、pI向上度、真のバインダーとの整合性スコアといった指標を用いて、マルチオブジェクティブ最適化の成否を評価。

実験結果

リサーチクエスチョン

  • RQ1直接的好み最適化(DPO)をタンパク質言語モデルに適用することで、結合親和性および物理的・化学的性質を含む複数の設計目的を満たすペプチドバインダーを効果的に生成できるか?
  • RQ2DPOは、低混乱度と真のバインダーとの類似性を維持したまま、生成バインダーの等電点(pI)をどの程度向上させられるか?
  • RQ3合成可能性や発現失敗といった数量的でない制約を含む熟練者がキュレートした選好データを組み込むことで、生成バインダーの質と多様性はどのように変化するか?
  • RQ4SFTに比べて、DPOは好ましい配列分布と望ましい物理的・化学的性質を両方満たすバインダーの生成において優れているか?
  • RQ5本フレームワークは、ペプチドに限らず、他のタンパク質や低分子化合物の設計タスクにも一般化可能か?

主な発見

  • DPO最適化モデルはテスト正解率97%、報酬マージン15.3を達成し、好ましいと好ましくない配列の間の選好識別が強く行われていることが示された。
  • ビームサーチ、トップ-k、グリーディサンプリングの全サンプリング戦略において、等電点(pI)が17%〜60%の中央値改善が確認され、50%のバインダーでpIが2倍に向上した。
  • 全サンプリング手法において混乱度が低く保たれ、50%の生成バインダーで混乱度が1.5未満、90%で40未満であった。DPOによる配列品質の著しい低下は認められなかった。
  • DPO適用後、同じタンパク質クラスタ内での真のバインダーとの整合性スコアが顕著に向上し、生物学的に関連する配列との類似性が向上したことが確認された。
  • DPOにより、発現失敗や合成不能性といった、数量的でない熟練者の基準を、選好信号としてモデルに効果的に統合できた。これにより、単一の特性最適化を超えた設計制約の範囲が拡張された。
  • 本アプローチにより、pLMにマルチオブジェクティブ設計基準をスムーズかつエンドツーエンドで統合でき、後処理のフィルタリングに依存する必要が減少し、開発可能なリード化合物を生成する可能性が高まった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。