Skip to main content
QUICK REVIEW

[論文レビュー] Interpreting BERT architecture predictions for peptide presentation by MHC class I proteins

Hans-Christof Gasser, Georges Bedran|arXiv (Cornell University)|Nov 13, 2021
vaccines and immunoinformatics approaches被引用数 6
ひとこと要約

本稿では、ペプチド配列およびフラッギング領域に加えてMHCクラスI分子のアレルンを組み合わせて、MHCクラスI分子によるペプチド提示を予測するBERTベースの深層学習モデル、ImmunoBERTを紹介する。SHAPおよびLIMEの解釈可能性手法を適用することで、N末端およびC末端のペプチドリジューと特定のMHC-Iポケットリジュー(A、B、F)が提示に重要であることが同定され、3次元可視化とモチーフ解析により生物学的メカニズムが裏付けられた。

ABSTRACT

The major histocompatibility complex (MHC) class-I pathway supports the detection of cancer and viruses by the immune system. It presents parts of proteins (peptides) from inside a cell on its membrane surface enabling visiting immune cells that detect non-self peptides to terminate the cell. The ability to predict whether a peptide will get presented on MHC Class I molecules helps in designing vaccines so they can activate the immune system to destroy the invading disease protein. We designed a prediction model using a BERT-based architecture (ImmunoBERT) that takes as input a peptide and its surrounding regions (N and C-terminals) along with a set of MHC class I (MHC-I) molecules. We present a novel application of well known interpretability techniques, SHAP and LIME, to this domain and we use these results along with 3D structure visualizations and amino acid frequencies to understand and identify the most influential parts of the input amino acid sequences contributing to the output. In particular, we find that amino acids close to the peptides' N- and C-terminals are highly relevant. Additionally, some positions within the MHC proteins (in particular in the A, B and F pockets) are often assigned a high importance ranking - which confirms biological studies and the distances in the structure visualizations.

研究の動機と目的

  • ワクチン設計の重要なステップであるMHCクラスI分子によるペプチド提示を正確に予測する深層学習モデルの開発。
  • モデルに依存しない解釈可能性技術(SHAPおよびLIME)を用いて、予測の解釈を行い、生物学的に関連する配列特徴を同定すること。
  • 3次元構造可視化と配列モチーフ解析を用いて、モデルの解釈を検証すること。
  • 希少なアレルンを含む多様なMHC-Iアレルンにわたるモデルの汎化能力を示し、パーソナライズド免疫療法を支援すること。
  • 深層学習の予測を生物学的・臨床的知見と結びつけることで、計算的および生物学的理解の橋渡しをすること。

提案手法

  • モデルであるImmunoBERTは、9-アミノ酸ペプチド、そのNフラッギングおよびCフラッギング領域、およびMHC-Iアレルン配列を含む入力配列を処理するBERTベースのアーキテクチャを採用する。
  • 実験的に決定されたペプチド-MHC-I結合親和性データセットを用いて微調整することで、提示可能性の予測を行う。
  • SHAPおよびLIMEを用いて、ペプチド、フラッギング領域、およびMHC-Iタンパク質内の各アミノ酸の重要度スコアを生成する。
  • ペプチド-MHC複合体の3次元構造可視化を用いて、SHAPおよびLIMEで同定された高重要度リジューの空間的関連性を検証する。
  • 予測された免疫原性ペプチドに対して配列モチーフ解析を実施し、既知の生物学的モチーフと整合する繰り返しパターンを同定する。
  • SOTA手法(NetMHCpanおよびMHCflurry)と比較してモデルの性能をベンチマークし、同等の予測精度を示した。

実験結果

リサーチクエスチョン

  • RQ1ペプチドおよびMHC-I分子のどの領域がMHC-Iによるペプチド提示に最も影響を与えるか?
  • RQ2SHAPおよびLIMEの特徴重要度スコアは、MHC-I抗原提示の既知の構造的および生物学的メカニズムとどの程度一致するか?
  • RQ3モデルの予測および解釈は、希少アレルンを含むさまざまなMHC-Iアレルンにどのように一般化されるか?
  • RQ43次元構造可視化と配列モチーフ解析は、SHAPおよびLIMEの解釈性の発見を裏付けることができるか?
  • RQ5ペプチドフラッギング領域(N-およびC-フラッグ)は提示予測にどの程度寄与するか?コアペプチドとの比較ではどうなるか?

主な発見

  • SHAPおよびLIMEの両方とも、9-アミノ酸ペプチドのN末端およびC末端に近いアミノ酸が一貫して高い重要度を示しており、MHC-I提示におけるその重要な役割を示している。
  • 特にHLA-B*54:01の位置66、95、116に位置するMHC-Iリジュー(A、B、Fポケット)が顕著に影響を及ぼすことが同定され、ペプチド結合の既知の構造生物学と一致した。
  • HLA-B*54:01の予測モチーフは、アミノ酸位置2および9に疎水性アミノ酸(例:アラニン、バリン、ロイシン)の豊富なパターンを示し、既知の結合嗜好性と整合的であった。
  • 3次元可視化により、高重要度MHCリジュー(例:位置95のトリプトファンおよび位置116のロイシン)が、それぞれペプチドのC末端およびFポケットと疎水性相互作用を形成していることが確認された。
  • ペプチドフラッギング領域はコアペプチドほど予測に寄与しなかったが、含まれることでわずかだが一貫したモデル性能の向上が見られた。
  • モデルは、未観測のMHC-Iアレルンに対しても一般化を示し、ホールドアウトされたアレルンにおいても一貫したモチーフパターンと解釈可能性の結果が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。