Skip to main content
QUICK REVIEW

[論文レビュー] Harnessing Preference Optimisation in Protein LMs for Hit Maturation in Cell Therapy

Katarzyna Janocha, Alan C. H. Ling|arXiv (Cornell University)|Dec 2, 2024
Viral Infectious Diseases and Gene Expression in Insects被引用数 4
ひとこと要約

本稿では、高スループットの実験データを用いたタンパク質言語モデル(PLM)の好みの微調整を提案し、キメラ抗原レセプター(CAR)治療におけるヒット成熟を加速する。細胞アッセイでテストされた数千のCARバリアントから得た好みのデータセットを用いて自己回帰的PLMを微調整することで、予測された損失と生物学的パフォーマンスの間に強い相関(r = -0.574)を達成し、少数のサンプルで改善されたCAR突然変異体の発見が可能になる。

ABSTRACT

Cell and immunotherapy offer transformative potential for treating diseases like cancer and autoimmune disorders by modulating the immune system. The development of these therapies is resource-intensive, with the majority of drug candidates failing to progress beyond laboratory testing. While recent advances in machine learning have revolutionised areas such as protein engineering, applications in immunotherapy remain limited due to the scarcity of large-scale, standardised datasets and the complexity of cellular systems. In this work, we address these challenges by leveraging a high-throughput experimental platform to generate data suitable for fine-tuning protein language models. We demonstrate how models fine-tuned using a preference task show surprising correlations to biological assays, and how they can be leveraged for few-shot hit maturation in CARs. This proof-of-concept presents a novel pathway for applying ML to immunotherapy and could generalise to other therapeutic modalities.

研究の動機と目的

  • 免疫療法における大規模で標準化されたデータセットの不足に応えるために、数千のCARバリアントからの高スループット実験データを生成すること。
  • 好みの最適化によって微調整されたタンパク質言語モデルが、生物学的に関連するCARのパフォーマンスを予測できるかどうかを検討すること。
  • モデルが生成する予測を活用して配列空間の探索を誘導することで、CAR設計における少数のサンプルでのヒット成熟を可能にすること。
  • このようなモデルが未観測のCAR配列に一般化できるかを評価し、保留された検証セット上でその予測能力を検証すること。

提案手法

  • 高スループットT細胞レポーター・アッセイからの実験データを用いて、好み学習の目的関数で事前に学習済みの自己回帰的タンパク質言語モデルを微調整する。
  • 親CARに対する単一および二重突然変異体の相対的パフォーマンス(ΔGFP)を比較することで、好みのデータセットを構築する。
  • 親CARの周囲の配列空間を探索するため、多様性を考慮した生成関数を用いたグリーディ探索を実施し、候補となる突然変異体を生成する。
  • 訓練および検証データセット全体でモデル損失と実験的ΔGFP値の相関を測ることで、モデルの予測を評価する。
  • 高スループットアッセイデータにおけるプレート固有のバイアスを補正するため、正規化を適用する。
  • 各位置で上位k個のアミノ酸置換を選択する再帰的生成関数を用い、有効な配列を有効性フィルタで保証する。
Figure 1: CAR structure with scFV and VHH binding domains (see text for details).
Figure 1: CAR structure with scFV and VHH binding domains (see text for details).

実験結果

リサーチクエスチョン

  • RQ1好みの学習によって微調整されたタンパク質言語モデルは、CAR-T細胞療法における生物学的に関連するパフォーマンスの向上を予測できるか?
  • RQ2モデル損失は、高スループットアッセイにおける実際の実験的読み出し(ΔGFP)とどの程度相関しているか?
  • RQ3モデルは、優れたCAR突然変異体を発見するための効果的な少数のサンプルでの配列空間探索を誘導できるか?
  • RQ4モデルは検証セットにおける未観測のCAR配列に一般化できるか?
  • RQ5モデルが高性能な突然変異体を発見する能力に影響を与える要因は何か? そのパフォーマンスは生物学的構造に起因するのか、データアーチファクトに起因するのか?

主な発見

  • 微調整済みPLMは、実験的T細胞レポーター活性(ΔGFP)と強い負のピアソン相関(r = -0.574)を示し、予測能力を示している。
  • 候補1では相関がさらに強く(r = -0.699)なり、事前学習済みモデルと比較して微調整により相関が顕著に向上した(r = 0.218 から r = -0.699 へ)。
  • グリーディ探索と全探索の両方とも、親CARを上回る突然変異体を同定した。いくつかの突然変異体は、親の2倍以上の性能を示した。
  • 10のテスト配列のうち7つで、親配列ごとに少なくとも1つの突然変異体が親を上回り、検証セット(S8–S10)でも同様の傾向が見られた。これは一般化の可能性を示唆している。
  • モデルの予測性能は、候補1の方が候補2よりも高いが、その背後にある要因(生物学的要因かデータ関連要因か)はまだ明確でない。
  • 全探索はグリーディ探索よりも優れた結果をもたらした。これは、高い計算コストを伴うが、包括的な探索の重要性を示している。
Figure 2: Simplified candidate generation pipeline. Using phage display based on a highly diverse starting library we screen for binders to the target of interest using phage display. Resulting candidates are evaluated in cells in scalable proprietary assays.
Figure 2: Simplified candidate generation pipeline. Using phage display based on a highly diverse starting library we screen for binders to the target of interest using phage display. Resulting candidates are evaluated in cells in scalable proprietary assays.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。