Skip to main content
QUICK REVIEW

[논문 리뷰] Protein identification with deep learning: from abc to xyz

Ngoc Hieu Tran, Zachariah Levine|arXiv (Cornell University)|2017. 10. 08.
Machine Learning in Bioinformatics참고 문헌 17인용 수 3
한 줄 요약

이 논문은 터널 질량 분석 데이터에서 단백질을 식별하기 위해 컨volutional 신경망과 순환 신경망을 사용하여 데 노보 단백질 시퀀스 분석과 데이터베이스 검색을 통합하는 딥러닝 프레임워크인 DeepNovo를 소개한다. 시퀀스 예측과 de Bruijn 그래프 어셈블리의 조합을 통해 DeepNovo는 높은 정확도로 단백질 식별을 달성하였으며, 재현 가능성을 위해 GitHub에 오픈소스 모델과 튜토리얼을 제공하여 단백질체학 연구 분야에서의 광범위한 채택을 지원한다.

ABSTRACT

Proteins are the main workhorses of biological functions in a cell, a tissue, or an organism. Identification and quantification of proteins in a given sample, e.g. a cell type under normal/disease conditions, are fundamental tasks for the understanding of human health and disease. In this paper, we present DeepNovo, a deep learning-based tool to address the problem of protein identification from tandem mass spectrometry data. The idea was first proposed in the context of de novo peptide sequencing [1] in which convolutional neural networks and recurrent neural networks were applied to predict the amino acid sequence of a peptide from its spectrum, a similar task to generating a caption from an image. We further develop DeepNovo to perform sequence database search, the main technique for peptide identification that greatly benefits from numerous existing protein databases. We combine two modules de novo sequencing and database search into a single deep learning framework for peptide identification, and integrate de Bruijn graph assembly technique to offer a complete solution to reconstruct protein sequences from tandem mass spectrometry data. This paper describes a comprehensive protocol of DeepNovo for protein identification, including training neural network models, dynamic programming search, database querying, estimation of false discovery rate, and de Bruijn graph assembly. Training and testing data, model implementations, and comprehensive tutorials in form of IPython notebooks are available in our GitHub repository (https://github.com/nh2tran/DeepNovo).

연구 동기 및 목표

  • 터널 질량 분석 데이터에서 단백질 식별을 향상시키기 위해 데 노보 시퀀싱과 데이터베이스 검색을 통합한 통합 딥러닝 프레임워크를 개발하는 것.
  • 스펙트럼 데이터에 기반한 신경망을 활용하여 펩타이드 식별의 정확성과 효율성을 향상시키는 것.
  • 데 노보 시퀀스 예측을 위한 딥러닝 파이프라인에 de Bruijn 그래프 어셈블리를 통합하여 파편화된 펩타이드 데이터에서 전체 단백질 시퀀스를 재구성하는 것.
  • 모델 훈련, 가짜 발견률 추정, 동적 프로그래밍 검색을 포함한 완전한 재현 가능한 워크플로우를 제공하는 것.
  • 단백질체학 연구 분야의 채택을 지원하기 위해 훈련 데이터, 모델 구현, 튜토리얼을 GitHub 레포지터리에서 공개하는 것.

제안 방법

  • 터널 질량 분석(MS/MS) 스펙트럼에서 특징을 추출하기 위해 컨volutional 신경망(CNNs)을 사용하는 것.
  • 아미노산 예측의 순차적 의존성을 모델링하기 위해 순환 신경망(RNNs), 특히 양방향 LSTM 레이어를 사용하는 것.
  • 데 노보 시퀀싱과 데이터베이스 검색을 하나의 엔드 투 엔드 프레임워크로 통합한 공동 아키텍처를 설계하는 것.
  • 스펙트럼 정렬 점수를 기반으로 펩타이드 시퀀스 후보를 개선하기 위해 동적 프로그래밍을 적용하는 것.
  • 식별된 펩타이드로부터 전체 단백질 시퀀스를 재구성하기 위해 de Bruijn 그래프 어셈블리를 통합하는 것.
  • 딥러닝 파이프라인 내에서 타겟-데코이 데이터베이스 전략을 사용하여 가짜 발견률을 추정하는 것.

실험 결과

연구 질문

  • RQ1통합 딥러닝 모델이 데 노보 시퀀싱과 데이터베이스 검색을 효과적으로 통합하여 펩타이드 식별 정확도를 향상시킬 수 있는가?
  • RQ2de Bruijn 그래프 어셈블리의 통합이 MS/MS 데이터로부터 단백질 시퀀스 재구성에 어떻게 기여하는가?
  • RQ3제안된 엔드 투 엔드 딥러닝 프레임워크가 전통적 방법에 비해 단백질 식별 작업에서 얼마나 뛰어난 성능을 보이는가?
  • RQ4공개된 도구와 튜토리얼을 통해 해석 가능성과 재현 가능성을 유지하면서도 이 프레임워크가 높은 성능을 달성할 수 있는가?

주요 결과

  • DeepNovo는 MS/MS 스펙트럼에서 직접 아미노산 시퀀스를 예측하기 위해 CNNs와 RNNs를 활용함으로써 데 노보 펩타이드 시퀀싱 분야에서 최고 수준의 성능를 달성한다.
  • 딥러닝 프레임워크 내부에 데이터베이스 검색을 통합함으로써 독립적인 데 노보 방법에 비해 식별 정확도가 크게 향상된다.
  • de Bruijn 그래프 어셈블리의 사용은 펩타이드 식별에서 전체 단백질 시퀀스를 안정적으로 재구성할 수 있게 하여 생물학적 해석 가능성을 향상시킨다.
  • 이 프레임워크는 단백질체학에서 통계적 검증을 위한 필수 조건인 신뢰할 수 있는 가짜 발견률 추정을 지원한다.
  • 포괄적인 훈련 데이터, 모델 가중치, IPython 노트북 튜토리얼이 공개되어 있어 재현 가능성을 보장하고 커뮤니티의 채택을 촉진한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.