[논문 리뷰] Discovery of Proteomics based on Machine learning
이 논문은 레이블 프리 프로테오믹스에서 펩타이드 검출 확률을 예측하기 위한 머신러닝 프레임워크를 제안한다. 네 가지 플랫폼에서 약 100만 개의 펩타이드 식별 결과를 바탕으로 SVM 및 랜덤 포레스트 분류기를 사용하여, 물리화학적 특성에 기반한 트리프신 펩타이드의 관측 가능성 예측을 통해 절대 단백질 농도를 정확하게 추정함으로써 프로테오믹스 워크플로우에서의 정량화를 향상시킨다.
The ultimate target of proteomics identification is to identify and quantify the protein in the organism. Mass spectrometry (MS) based on label-free protein quantitation has mainly focused on analysis of peptide spectral counts and ion peak heights. Using several observed peptides (proteotypic) can identify the origin protein. However, each peptide's possibility to be detected was severely influenced by the peptide physicochemical properties, which confounded the results of MS accounting. Using about a million peptide identification generated by four different kinds of proteomic platforms, we successfully identified >16,000 proteotypic peptides. We used machine learning classification to derive peptide detection probabilities that are used to predict the number of trypic peptides to be observed, which can serve to estimate the absolutely abundance of protein with highly accuracy. We used the data of peptides (provides by CAS lab) to derive the best model from different kinds of methods. We first employed SVM and Random Forest classifier to identify the proteotypic and unobserved peptides, and then searched the best parameter for better prediction results. Considering the excellent performance of our model, we can calculate the absolutely estimation of protein abundance.
연구 동기 및 목표
- 표준 스펙트럼 수 방법보다 정확도를 높이기 위해 레이블 프리 프로테오믹스에서 절대 단백질 농도 추정의 정확도를 향상시키기 위해 펩타이드 검출 확률을 모델링하는 것.
- MS 검출 빈도에 영향을 주는 펩타이드 물리화학적 특성의 혼란 요인을 해결하는 것.
- 다양한 프로테오믹스 플랫폼에서 가장 검출될 가능성이 높은 프로테오타입 펩타이드를 식별하는 것.
- 대규모 펩타이드 식별 데이터를 기반으로 한 강력하고 일반화 가능한 머신러닝 모델을 개발하는 것.
- 스펙트럼 수 및 피크 강도 데이터의 검출 편향을 보정하여 더 신뢰할 수 있고 정량적인 프로테오믹스 프로파일링을 가능하게 하는 것.
제안 방법
- 저자는 네 가지 다른 프로테오믹스 플랫폼에서 약 100만 개의 펩타이드 식별 결과를 수집하여 모델의 학습 및 검증을 수행하였다.
- 지원 벡터 머신(SVM)과 랜덤 포레스트 분류기를 사용하여 물리화학적 특성에 기반해 프로테오타입(검출됨) 및 비프로테오타입(미검출) 펩타이드를 구분하였다.
- 펩타이드 특징은 수용성, 전하, 길이 등 MS 검출 가능성에 영향을 주는 물리화학적 특성에서 유도되었다.
- 다양한 분류 방법에서의 성능 최적화를 위해 하이퍼파rameter 튜닝을 수행하였다.
- 최종 모델은 펩타이드 검출 확률을 예측하였으며, 이는 각 단백질당 관측 가능한 트리프신 펩타이드 수를 추정하는 데 사용되었다.
- 예측된 펩타이드 관측 가능성은 단백질 농도 추정에 통합되어 표준 스펙트럼 수 방법에 비해 정확도를 향상시켰다.
실험 결과
연구 질문
- RQ1머신러닝 모델은 질량 분석 기반 프로테오믹스에서 펩타이드 검출 가능성을 정확하게 예측할 수 있는가?
- RQ2펩타이드의 물리화학적 특성은 레이블 프리 정량화에서 검출 가능도에 어떤 영향을 미치는가?
- RQ3여러 프로테오믹스 플랫폼에서 학습된 통합 모델이 다양한 실험 조건으로 일반화될 수 있는가?
- RQ4검출 가능도를 통합함으로써 절대 단백질 농도 추정의 정확도는 어느 정도 향상되는가?
- RQ5프로테오타입 펩타이드를 예측하기 위한 최적의 머신러닝 알고리즘과 특징 세트는 무엇인가?
주요 결과
- 모델은 약 100만 개의 펩타이드 식별 결과로 구성된 데이터셋에서 16,000개 이상의 프로테오타입 펩타이드를 성공적으로 식별하였다.
- 랜덤 포레스트 및 SVM 분류기는 물리화학적 특성에 기반해 검출 가능 및 미검출 펩타이드를 높은 성능으로 구분하였다.
- 예측된 검출 가능도는 표준 스펙트럼 수 방법에 비해 절대 단백질 농도 추정의 정확도를 크게 향상시켰다.
- 모델는 다양한 프로테오믹스 플랫폼 간에 강력한 일반화 능력을 보이며 기술적 변동성에 대한 내구성을 입증하였다.
- 검출 가능도를 정량화에 통합함으로써 내재된 펩타이드 검출 가능성에 기인한 편향을 줄여 더 신뢰할 수 있는 단백질 농도 추정을 가능하게 하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.