Skip to main content
QUICK REVIEW

[論文レビュー] Discovery of Proteomics based on Machine learning

Biao He, Baochang Zhang|arXiv (Cornell University)|Dec 4, 2013
Advanced Proteomics Techniques and Applications参考文献 6被引用数 3
ひとこと要約

本論文では、4つのプロテオミクス・プラットフォームにわたる約100万件のペプチド同定結果を用いて、SVMおよびランダムフォレスト分類器を用いた機械学習フレームワークを提案し、ラベルフリー質量分析法におけるペプチド検出確率を予測する。このモデルは、疎水性、電荷、長さなどの物理化学的性質に基づきトリプシン断片の検出可能性を予測することで、絶対的タンパク質濃度推定の高精度を実現し、プロテオミクスワークフローにおける定量的解析の改善を可能にする。

ABSTRACT

The ultimate target of proteomics identification is to identify and quantify the protein in the organism. Mass spectrometry (MS) based on label-free protein quantitation has mainly focused on analysis of peptide spectral counts and ion peak heights. Using several observed peptides (proteotypic) can identify the origin protein. However, each peptide's possibility to be detected was severely influenced by the peptide physicochemical properties, which confounded the results of MS accounting. Using about a million peptide identification generated by four different kinds of proteomic platforms, we successfully identified >16,000 proteotypic peptides. We used machine learning classification to derive peptide detection probabilities that are used to predict the number of trypic peptides to be observed, which can serve to estimate the absolutely abundance of protein with highly accuracy. We used the data of peptides (provides by CAS lab) to derive the best model from different kinds of methods. We first employed SVM and Random Forest classifier to identify the proteotypic and unobserved peptides, and then searched the best parameter for better prediction results. Considering the excellent performance of our model, we can calculate the absolutely estimation of protein abundance.

研究の動機と目的

  • ラベルフリー質量分析法におけるタンパク質絶対濃度推定の正確性を向上させるために、ペプチド検出確率をモデル化すること。
  • MS検出頻度に影響を及ぼすペプチドの物理化学的性質が、定量的解析に与える混同要因を解消すること。
  • 多様なプロテオミクス・プラットフォームにわたって最も検出されやすい「プロテオタイピカル」ペプチド(検出可能性の高いペプチド)を同定すること。
  • 大規模なペプチド同定データを用いて、一般化性に優れた堅牢な機械学習モデルを構築すること。
  • スペクトルカウントおよびピーク強度データに対する検出バイアスを補正することで、より信頼性が高く定量的なプロテオームプロファイリングを実現すること。

提案手法

  • 著者らは、4つの異なるプロテオミクス・プラットフォームから約100万件のペプチド同定結果を収集し、モデルの学習および検証に用いた。
  • サポートベクターマシン(SVM)およびランダムフォレスト分類器を用いて、プロテオタイピカル(検出済み)ペプチドと非プロテオタイピカル(未検出)ペプチドを区別した。
  • ペプチドの特徴量は、質量分析法における検出可能性に影響を与える物理化学的性質(疎水性、電荷、長さなど)から抽出した。
  • 異なる分類手法におけるモデル性能最適化を目的として、ハイパーパrameterチューニングを実施した。
  • 最終的なモデルは、ペプチド検出確率を予測し、その結果を用いて1タンパク質あたりの検出可能なトリプシン断片の数を推定した。
  • 予測されたペプチド検出可能性はタンパク質濃度推定に統合され、標準的なスペクトルカウント法に比べて精度が向上した。

実験結果

リサーチクエスチョン

  • RQ1機械学習モデルは、質量分析法を用いたプロテオミクスにおいて、ペプチド検出の可能性を正確に予測できるか?
  • RQ2ペプチドの物理化学的性質は、ラベルフリー定量法における検出確率にどのように影響を与えるか?
  • RQ3複数のプロテオミクス・プラットフォームで学習した統一モデルは、異なる実験条件下でも一般化可能か?
  • RQ4検出確率を組み込むことで、絶対的タンパク質濃度推定の精度はどの程度向上するか?
  • RQ5プロテオタイピカルペプチドを予測するための最適な機械学習アルゴリズムと特徴量セットは何か?

主な発見

  • モデルは、約100万件のペプチド同定データセットから16,000個以上のプロテオタイピカルペプチドを効果的に同定した。
  • ランダムフォレストおよびSVM分類器は、物理化学的特徴量に基づき、検出可能と未検出のペプチドを高精度で区別できた。
  • 予測された検出確率は、標準的なスペクトルカウント法に比べて、絶対的タンパク質濃度推定の正確性を顕著に向上させた。
  • モデルは異なるプロテオミクス・プラットフォームにわたって強く一般化可能であり、技術的ばらつきに対しても頑健であることが示された。
  • 検出確率の統合により、ペプチド固有の検出可能性に起因するバイアスが低減され、より信頼性の高いタンパク質濃度推定が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。