Skip to main content
QUICK REVIEW

[論文レビュー] Deciphering the Language of Nature: A transformer-based language model for deleterious mutations in proteins

Theodore Jiang, Fang Li|arXiv (Cornell University)|Oct 27, 2021
Machine Learning in Bioinformatics被引用数 4
ひとこと要約

MutFormer は、自己注意機構と畳み込み層を用いて、長距離および短距離の配列依存関係を捉えることで、リファレンスおよび変異タンパク質配列を活用して有害なスプライシング以外のアミノ酸置換を予測するトランスフォーマーに基づく深層学習モデルである。複数のベンチマークデータセットにおいて最先端の性能を達成しており、従来の手法では調査されていなかった生物学的に関連する配列特徴を捉えることで、既存のツールを上回るか同等の性能を発揮している。

ABSTRACT

Various machine-learning models, including deep neural network models, have already been developed to predict deleteriousness of missense (non-synonymous) mutations. Potential improvements to the current state of the art, however, may still benefit from a fresh look at the biological problem using more sophisticated self-adaptive machine-learning approaches. Recent advances in the natural language processing field show transformer models-a type of deep neural network-to be particularly powerful at modeling sequence information with context dependence. In this study, we introduce MutFormer, a transformer-based model for the prediction of deleterious missense mutations, which uses reference and mutated protein sequences from the human genome as the primary features. MutFormer takes advantage of a combination of self-attention layers and convolutional layers to learn both long-range and short-range dependencies between amino acid mutations in a protein sequence. In this study, we first pre-trained MutFormer on reference protein sequences and mutated protein sequences resulting from common genetic variants observed in human populations. We next examined different fine-tuning methods to successfully apply the model to deleteriousness prediction of missense mutations. Finally, we evaluated MutFormer's performance on multiple testing data sets. We found that MutFormer showed similar or improved performance over a variety of existing tools, including those that used conventional machine-learning approaches. We conclude that MutFormer successfully considers sequence features that are not explored in previous studies and could potentially complement existing computational predictions or empirically generated functional scores to improve our understanding of disease variants.

研究の動機と目的

  • スプライシング以外の有害なアミノ酸置換の予測を向上させるために、高度な配列モデリング技術を用いた新しい深層学習モデルの開発。
  • トランスフォーマーアーキテクチャの文脈に敏感な機能を活用し、タンパク質配列内の複雑な依存関係を捉えること。
  • ヒト集団遺伝変異を事前学習し、有害性予測のための微調整を実施すること。
  • 多様で独立したテストデータセット上で、既存のツールと比較して性能を評価すること。
  • 従来のモデルが捉えていなかった配列特徴を同定し、病原性予測の生物学的解釈可能性を向上させること。

提案手法

  • MutFormer は、マルチヘッド自己注意層と畳み込み層を組み合わせたハイブリッドアーキテクチャを採用しており、タンパク質配列における長距離および局所的依存関係をモデル化する。
  • モデルは、一般的なヒト遺伝変異から得られるリファレンスおよび変異タンパク質配列を用いて事前学習され、一般化された配列表現を学習する。
  • 既知の有害および中立的スプライシング以外のアミノ酸置換を含むラベル付きデータセットを用いた教師あり学習により、微調整が実施される。
  • 入力特徴は、ワイルドタイプおよび変異アミノ酸配列の両方を含み、特定の置換の影響をモデルが学習できるようにする。
  • 位置エンコーディングが使用され、配列の順序と文脈が保持され、タンパク質構造および機能における突然変異の影響を捉える上で重要である。
  • 複数の独立したテストセットを用いて、AUC-ROC や AUPRC といった標準指標による性能評価が実施される。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のモデルは、既存の機械学習ツールを上回って有害なスプライシング以外のアミノ酸置換を予測できるか?
  • RQ2MutFormer は、従来のモデルが捉えていない、特に文脈依存的なパターンをどのような配列レベルの特徴として学習しているか?
  • RQ3集団レベルの遺伝変異を用いた事前学習は、下流の予測性能の向上にどの程度効果的か?
  • RQ4自己注意機構は、機能的に破壊的な突然変異の検出をどの程度向上させるか?
  • RQ5MutFormer は、ヒトタンパク質における多様な遺伝的および機能的文脈に一般化できるか?

主な発見

  • MutFormer は、gnomAD や ClinVar を含む複数のベンチマークデータセットにおいて、最先端のツールと同等または優れた性能を示している。
  • 独立したテストセットにおいて、AUC-ROC スコアが向上しており、優れた一般化能力を示している。
  • 自己注意機構により、アミノ酸位置間の長距離依存関係を捉えることができ、予測精度が向上している。
  • 畳み込み層の統合により、局所的配列文脈のモデリングが向上し、病原性バリアントのより良い識別に寄与している。
  • MutFormer は、保存されたリジドや構造的モチーフといった生物学的に関連する配列パターンを同定しており、これらは有害性と相関している。
  • 微調整戦略が性能を顕著に向上させ、この分野におけるトランスファー学習の価値を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。