[論文レビュー] Deep Recurrent Neural Network for Protein Function Prediction from Sequence
本論文では、アミノ酸配列のアラインメントや特徴工学を用いずに、直接アミノ酸配列からタンパク質機能を予測するための深層再帰ニューラルネットワーク(RNN)を提案する。UniProtデータで学習されたモデルは、クラス内およびクラス外の予測において高い精度を達成しており、既知の相同体と低い相同性を示すフェリチン様タンパク質の実験的検証済み発見も可能である。
As high-throughput biological sequencing becomes faster and cheaper, the need to extract useful information from sequencing becomes ever more paramount, often limited by low-throughput experimental characterizations. For proteins, accurate prediction of their functions directly from their primary amino-acid sequences has been a long standing challenge. Here, machine learning using artificial recurrent neural networks (RNN) was applied towards classification of protein function directly from primary sequence without sequence alignment, heuristic scoring or feature engineering. The RNN models containing long-short-term-memory (LSTM) units trained on public, annotated datasets from UniProt achieved high performance for in-class prediction of four important protein functions tested, particularly compared to other machine learning algorithms using sequence-derived protein features. RNN models were used also for out-of-class predictions of phylogenetically distinct protein families with similar functions, including proteins of the CRISPR-associated nuclease, ferritin-like iron storage and cytochrome P450 families. Applying the trained RNN models on the partially unannotated UniRef100 database predicted not only candidates validated by existing annotations but also currently unannotated sequences. Some RNN predictions for the ferritin-like iron sequestering function were experimentally validated, even though their sequences differ significantly from known, characterized proteins and from each other and cannot be easily predicted using popular bioinformatics methods. As sequencing and experimental characterization data increases rapidly, the machine-learning approach based on RNN could be useful for discovery and prediction of homologues for a wide range of protein functions.
研究の動機と目的
- アミノ酸配列のアラインメントや手動による特徴工学に依存せずに、タンパク質機能を予測する課題に対処すること。
- 系統的に遠く離れたタンパク質ファミリー間で類似した機能を有する場合に一般化できる機械学習手法を開発すること。
- 既知の機能クラスと類似する可能性のある未注釈化タンパク質の同定を可能にすること。
- とくに既知の機能相同体と低い相同性を示すものに対して、実験的に未同定の配列に対するモデルの予測能力を検証すること。
提案手法
- アミノ酸配列データを直接処理するための、長短記憶(LSTM)ユニットを備えた深層再帰ニューラルネットワーク(RNN)アーキテクチャを用いる。
- モデルは、UniProtの公開で注釈が付与されたタンパク質データセットから、機能クラスに関連する配列パターンの階層的表現を学習する。
- アラインメントやヒューリスティックスコアリングは使用せず、代わりに原始的なアミノ酸配列をトークンとして埋め込み・処理する。
- RNNは配列内の長距離依存関係を学習し、局所的に保存されていなくても機能モチーフの認識が可能になる。
- モデルは、CRISPR関連核酸分解酵素、フェリチン様鉄貯蔵、サイトクロムP450、その他の主要なタンパク質機能の4つの主要な機能について、ファインチューニングおよび評価が行われる。
- 訓練データから学習した機能的類似性を活用することで、系統的に異なるファミリーのクラス外予測が可能になる。
実験結果
リサーチクエスチョン
- RQ1アラインメントや特徴工学を用いずに、LSTMユニットを備えた深層RNNが、一次アミノ酸配列からタンパク質機能を正確に予測できるか?
- RQ2系統的に遠く離れたが機能的に類似するクラス外タンパク質ファミリーに対して、モデルの一般化性能はどの程度か?
- RQ3未注釈化の配列(例:UniRef100のような大規模データベース内)を同定し、それらの機能を予測できるか?
- RQ4既知の機能タンパク質と低い相同性を示す新規機能相同体を、どの程度発見できるか?
- RQ5RNNによる予測された機能は、特に従来手法が失敗する状況において、実験的に検証可能か?
主な発見
- RNNモデルは、他のハンドクラフトされた配列特徴に依存する機械学習手法よりも、4つの主要なタンパク質機能のクラス内予測で高い性能を達成した。
- モデルは、既知の相同体と低い相同性を示すタンパク質においても、フェリチン様鉄貯蔵機能を正確に予測し、実験的に検証された。
- クラス外予測により、相同性が低いにもかかわらず、系統的に異なるファミリー間で機能的に類似したタンパク質(例:CRISPR関連核酸分解酵素、サイトクロムP450)が同定された。
- 部分的に未注釈化のUniRef100データベースに適用したところ、既知の候補に加え、ターゲット機能が以前に注釈が付与されていなかった新規候補も予測された。
- 標準的なBLASTやその他の従来のバイオインフォマティクスツールでは検出できなかった、フェリチン様ファミリー内の機能相同体が、モデルによって発見・予測された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。