Skip to main content
QUICK REVIEW

[논문 리뷰] DeepRT: deep learning for peptide retention time prediction in proteomics

Chunwei Ma, Zhiyong Zhu|arXiv (Cornell University)|2017. 05. 15.
Advanced Proteomics Techniques and Applications참고 문헌 10인용 수 17
한 줄 요약

DeepRT는 펩타이드의 리텐션 타임을 액체 크로마토그래피-질량분석법(LC-MS/MS) 프로테오믹스에서 예측하기 위해 컨volutional 및 순환 신경망을 통해 엔드 투 엔드 특성 학습을 수행하는 딥러닝 프레임워크로, 수작업으로 설계된 특성에 의존하지 않는다. 이는 기존의 ELUDE 및 GPTime와 같은 방법들보다 뛰어난 성능을 보이며, 두 개의 공개 데이터셋에서 최신 기술 수준을 상회한다.

ABSTRACT

Accurate predictions of peptide retention times (RT) in liquid chromatography have many applications in mass spectrometry-based proteomics. Herein, we present DeepRT, a deep learning based software for peptide retention time prediction. DeepRT automatically learns features directly from the peptide sequences using the deep convolutional Neural Network (CNN) and Recurrent Neural Network (RNN) model, which eliminates the need to use hand-crafted features or rules. After the feature learning, principal component analysis (PCA) was used for dimensionality reduction, then three conventional machine learning methods were utilized to perform modeling. Two published datasets were used to evaluate the performance of DeepRT and we demonstrate that DeepRT greatly outperforms previous state-of-the-art approaches ELUDE and GPTime.

연구 동기 및 목표

  • 액체 크로마토그래피-질량분석법(LC-MS/MS) 워크플로우에서 정확한 펩타이드 리텐션 타임 예측 방법을 개발하는 것.
  • 수작업으로 설계된 특성 또는 리텐션 타임 예측 규칙이 필요 없도록 하는 것.
  • 딥 네ural 네트워크를 활용해 펩타이드 시퀀스에서 자동으로 특징을 추출하는 것.
  • 기존 최신 기술 수준의 방법들인 ELUDE 및 GPTime보다 예측 정확도를 향상시키는 것.
  • 재현 가능성을 확보하고 벤치마킹을 가능하게 하기 위해 공개된 데이터셋을 활용해 성능을 평가하는 것.

제안 방법

  • DeepRT는 펩타이드 아미노산 시퀀스에서 직접 시퀀스 수준의 특징을 학습하기 위해 딥 컨volution 신경망(CNN)과 순환 신경망(RNN) 아키텍처를 활용한다.
  • 모델은 사전 정의된 물리화학적 특성 기술자나 리텐션 규칙이 필요 없이 원시 펩타이드 시퀀스를 처리한다.
  • 특성 학습 이후 주성분 분석(PCA)을 적용하여 차원을 감소시키고 계산 효율을 향상시킨다.
  • 차원 감소된 특성 공간에 대해 세 가지 전통적인 기계학습 모델을 훈련시어 리텐션 타임을 예측한다.
  • 모델은 강건성과 일반화 능력을 보장하기 위해 두 개의 공개 프로테오믹스 데이터셋에서 훈련 및 검증된다.
  • 표준 회귀 평가 지표인 평균 절대 오차(MAE) 및 결정계수(R²)를 사용하여 모델 성능을 평가한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델은 수작업으로 설계된 특성 없이도 펩타이드 시퀀스에서 관련 리텐션 타임 특징을 직접 학습할 수 있는가?
  • RQ2엔드 투 엔드 딥러닝은 수작업으로 설계된 기술자에 의존하는 전통적 방법과 비교해 리텐션 타임 예측에서 어떻게 성능을 냈는가?
  • RQ3DeepRT는 벤치마크 데이터셋에서 ELUDE 및 GPTime와 같은 최신 기술 수준의 방법들과 비교해 어떤 성능을 보이는가?
  • RQ4PCA는 예측 정확도를 저하시키지 않으면서 모델 효율성을 얼마나 향상시키는가?
  • RQ5모델은 다양한 프로테오믹스 데이터셋과 실험 조건 간에 일반화 능력을 갖추고 있는가?

주요 결과

  • DeepRT는 두 개의 공개 데이터셋에서 ELUDE 및 GPTime와 같은 최신 기술 수준의 방법들보다 뚜렷이 뛰어난 성능을 보이며 펩타이드 리텐션 타임을 예측한다.
  • DeepRT는 ELUDE 및 GPTime보다 낮은 평균 절대 오차(MAE)를 기록하여 더 높은 예측 정확도를 입증한다.
  • 시퀀스에서 직접 특징을 학습함으로써 수작업 특성 설계나 리텐션 규칙이 필요 없어진다.
  • 딥 특징 학습 이후 PCA 통합은 예측 성능을 유지하면서 차원을 감소시킨다.
  • 독립된 데이터셋에서 강력한 일반화 능력을 보이며, 모델의 강건성을 검증한다.
  • CNN 및 RNN 아키텍처의 활용은 펩타이드 시퀀스의 국소적 및 순차적 패턴을 효과적으로 포착할 수 있게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.