Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning Methods for Protein Family Classification on PDB Sequencing Data

Aaron Wang|arXiv (Cornell University)|Jul 14, 2022
Machine Learning in Bioinformatics被引用数 6
ひとこと要約

本研究では、タンパク質データバンク(PDB)の一次配列データを用いて、タンパク質をファミリーに分類するためのディーブラーニングモデル——特に双方向LSTMおよび畳み込みニューラルネットワーク(CNN)——を評価した。CNNアーキテクチャは、古典的手法およびLSTMモデルを上回り、アミノ酸配列からのタンパク質ファミリー所属予測において優れた正確性を示した。

ABSTRACT

Composed of amino acid chains that influence how they fold and thus dictating their function and features, proteins are a class of macromolecules that play a central role in major biological processes and are required for the structure, function, and regulation of the body's tissues. Understanding protein functions is vital to the development of therapeutics and precision medicine, and hence the ability to classify proteins and their functions based on measurable features is crucial; indeed, the automatic inference of a protein's properties from its sequence of amino acids, known as its primary structure, remains an important open problem within the field of bioinformatics, especially given the recent advancements in sequencing technologies and the extensive number of known but uncategorized proteins with unknown properties. In this work, we demonstrate and compare the performance of several deep learning frameworks, including novel bi-directional LSTM and convolutional models, on widely available sequencing data from the Protein Data Bank (PDB) of the Research Collaboratory for Structural Bioinformatics (RCSB), as well as benchmark this performance against classical machine learning approaches, including k-nearest neighbors and multinomial regression classifiers, trained on experimental data. Our results show that our deep learning models deliver superior performance to classical machine learning methods, with the convolutional architecture providing the most impressive inference performance.

研究の動機と目的

  • アミノ酸配列のみを用いて、数百万ものアノテーションのないタンパク質を機能的ファミリーに分類する課題に対処すること。
  • 古典的手法よりもディーブラーニングモデルがPDB配列データにおけるタンパク質ファミリー分類で優れた性能を示すかどうかを評価すること。
  • 再帰的(LSTM)および畳み込み的(CNN)ニューラルネットワークの、逐次的タンパク質配列データのモデリングにおける相対的性能を調査すること。
  • 高精度な予測を達成しても生物学的洞察を妨げる要因となる、データ品質およびモデルの解釈可能性の制限を特定すること。

提案手法

  • タンパク質一次構造内の逐次的依存関係をモデル化するため、双方向LSTMネットワークを訓練した。
  • 複数の畳み込みブロック、バッチ正則化、ドロップアウト、ReLU活性化関数を備えた畳み込みニューラルネットワーク(CNN)を実装し、局所的およびグローバルな配列パターンを抽出した。
  • 同じPDBベースのデータセット上で、ディーブラーニングモデルを古典的手法(k近傍法(k-NN)および多項ロジスティック回帰)とベンチマーク比較した。
  • 入力特徴としてワンホットエンコードされたアミノ酸配列を使用し、タンパク質ファミリーを10クラスのターゲットラベルとした。
  • 過学習を防ぐために、エアリー・ストッピングおよび学習率スケジューリングを適用したが、正則化は限定的であった。
  • ハイパーパramータチューニングをグリッドサーチにより学習率および最適化手法の選択に対して行った。

実験結果

リサーチクエスチョン

  • RQ1PDB配列データにおいて、ディーブラーニングモデルは古典的手法よりも顕著にタンパク質ファミリー分類の正確性を向上させるか?
  • RQ2双方向LSTMとCNNのどちらのディーブラーニングアーキテクチャがタンパク質配列分類において優れた性能を示すか、その理由は何か?
  • RQ3結晶化温度(小数点1桁)などの低精度測定値といったデータ品質の問題が、特にk-NNおよび多項ロジスティック回帰のモデル性能にどのように影響するか?
  • RQ4過学習および解釈性の欠如が、生物学的分類タスクにおける高精度なディーブラーニングモデルの実用的有用性をどの程度制限するか?
  • RQ5ランダムオーバーサンプリングによるデータ拡張技術が、特にクラスが不均衡なタンパク質ファミリーのデータセットにおいて、モデル性能を向上させられるか?

主な発見

  • 畳み込みニューラルネットワーク(CNN)は、テストされたすべてのモデルの中で最高の推論正確性を達成し、双方向LSTMおよび古典的手法を上回った。
  • CNNモデルは、訓練正確度が約0.95、検証正確度が約0.80に達し、配列データに対する強力な学習能力を示した。
  • 双方向LSTMモデルは、訓練正確度0.94、検証正確度0.80を達成し、CNNと比較してやや低いが同等の性能を示した。
  • k-NNや多項ロジスティック回帰などの古典的手法は低性能にとどまり、kが増加するにつれてk-NNの正確度が低下した。これは、データのスパarsityおよび測定精度の問題により、近傍の類似性が有効でなかったことを示唆している。
  • 多項ロジスティック回帰モデルは、大多数のクラスを予測する傾向にあり、クラスの不均衡および低精度特徴がタンパク質ファミリー間の区別能力を損なったことを示している。
  • 両方のディーブラーニングモデルは、最初の5エポック以内に収束した。これは、データセットサイズに比べてモデルの複雑さが高く、パラメータ数が数百万に達するため、過学習の可能性があることを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。