Skip to main content
QUICK REVIEW

[論文レビュー] DeepRT: deep learning for peptide retention time prediction in proteomics

Chunwei Ma, Zhiyong Zhu|arXiv (Cornell University)|May 15, 2017
Advanced Proteomics Techniques and Applications参考文献 10被引用数 17
ひとこと要約

DeepRT は、畳み込みニューラルネットワークと再帰ニューラルネットワークを用いたエンド・ツー・エンドの特徴抽出により、手作業で設計された特徴量に依存せずに液体クロマトグラフィー質量分析法(LC-MS/MS)におけるペプチドの保持時間予測を行うディープラーニングフレームワークである。2つの公開データセットにおいて、先行手法である ELUDE や GPTime よりも顕著に優れた性能を達成している。

ABSTRACT

Accurate predictions of peptide retention times (RT) in liquid chromatography have many applications in mass spectrometry-based proteomics. Herein, we present DeepRT, a deep learning based software for peptide retention time prediction. DeepRT automatically learns features directly from the peptide sequences using the deep convolutional Neural Network (CNN) and Recurrent Neural Network (RNN) model, which eliminates the need to use hand-crafted features or rules. After the feature learning, principal component analysis (PCA) was used for dimensionality reduction, then three conventional machine learning methods were utilized to perform modeling. Two published datasets were used to evaluate the performance of DeepRT and we demonstrate that DeepRT greatly outperforms previous state-of-the-art approaches ELUDE and GPTime.

研究の動機と目的

  • 液体クロマトグラフィー質量分析法(LC-MS/MS)ワークフローにおける正確なペプチド保持時間予測手法の開発を目的とする。
  • 手作業で設計された特徴量や保持時間予測ルールの必要性を排除することを目的とする。
  • ディープニューラルネットワークを活用してペプチド配列から自動的に特徴量を抽出することを目的とする。
  • ELUDE や GPTime などの既存の最先端手法よりも予測精度を向上させることを目的とする。
  • 再現可能性とベンチマーク評価を確保するため、公開可能なデータセットを用いて性能を評価することを目的とする。

提案手法

  • DeepRT は、ペプチドアミノ酸配列から直接シーケンスレベルの特徴量を学習するため、深層畳み込みニューラルネットワーク(CNN)と再帰ニューラルネットワーク(RNN)のアーキテクチャを採用している。
  • モデルは、事前に定義された物理化学的記述子や保持時間ルールを必要とせず、原始的なペプチド配列を処理する。
  • 特徴量学習後に主成分分析(PCA)を適用し、次元削減を図り、計算効率を向上させている。
  • 次に、次元削減後の特徴空間上で3つの従来の機械学習モデルを訓練し、保持時間を予測している。
  • フレームワークは、堅牢性と一般化性能を確保するため、2つの公開済みプロテオミクスデータセットを用いて訓練および検証している。
  • モデルの性能は、平均絶対誤差(MAE)や決定係数(R²)といった標準的な回帰指標を用いて評価されている。

実験結果

リサーチクエスチョン

  • RQ1手作業で設計された特徴量に依存せずに、ディープラーニングモデルがペプチド配列から関連する保持時間特徴量を直接学習できるか?
  • RQ2エンジニアリングされた記述子に依存する従来手法と比較して、エンド・ツー・エンドのディープラーニングは保持時間予測においてどのように異なるか?
  • RQ3DeepRT の性能は、ELUDE や GPTime などの最先端手法と比較して、ベンチマークデータセット上でどのように評価されるか?
  • RQ4PCA の導入は、予測精度を劣化させることなく、どの程度モデルの効率性を向上させるか?
  • RQ5モデルは、異なるプロテオミクスデータセットや実験的条件下でも一般化可能か?

主な発見

  • DeepRT は、2つの公開データセットにおいて、最先端手法である ELUDE や GPTime よりも顕著に優れたペプチド保持時間予測性能を示している。
  • モデルは、ELUDE や GPTime よりも低い平均絶対誤差(MAE)を達成しており、より高い予測精度を示している。
  • 配列から直接特徴量を学習することで、手作業による特徴量設計や保持時間ルールの必要性が排除された。
  • ディープ特徴量学習後に PCA を統合することで、次元削減が実現されつつも、予測性能が保持された。
  • 独立したデータセットにおいても強力な一般化能力を示しており、モデルの堅牢性が裏付けられた。
  • CNN と RNN アーキテクチャの組み合わせにより、ペプチド配列内の局所的および順序的パターンの効果的な捉えが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。