Skip to main content
QUICK REVIEW

[논문 리뷰] ProLanGO: Protein Function Prediction Using Neural~Machine Translation Based on a Recurrent Neural Network

Renzhi Cao, Colton Freitas|arXiv (Cornell University)|2017. 10. 19.
RNA and protein synthesis mechanisms참고 문헌 41인용 수 15
한 줄 요약

이 논문은 단백질 기능 예측을 새로운 단백질 서열 언어(ProLan)에서 유전자 온톨로지 언어(GOLan)로의 번역 작업으로 간주하는 새로운 신경 기계 번역(NMT) 접근법인 ProLanGO를 소개한다. 순환 신경망 기반 NMT 모델을 사용하여 ProLanGO는 CAFA 3 벤치마크에서 경쟁적인 성능을 달성하며, 생물학적 서열 기능 예측에 신경 기계 번역을 적용할 수 있음을 입증하고, 기존 기준 모델을 능가하며 향후 발전 가능성도 보여준다.

ABSTRACT

With the development of next generation sequencing techniques, it is fast and cheap to determine protein sequences but relatively slow and expensive to extract useful information from protein sequences because of limitations of traditional biological experimental techniques. Protein function prediction has been a long standing challenge to fill the gap between the huge amount of protein sequences and the known function. In this paper, we propose a novel method to convert the protein function problem into a language translation problem by the new proposed protein sequence language "ProLan" to the protein function language "GOLan", and build a neural machine translation model based on recurrent neural networks to translate "ProLan" language to "GOLan" language. We blindly tested our method by attending the latest third Critical Assessment of Function Annotation (CAFA 3) in 2016, and also evaluate the performance of our methods on selected proteins whose function was released after CAFA competition. The good performance on the training and testing datasets demonstrates that our new proposed method is a promising direction for protein function prediction. In summary, we first time propose a method which converts the protein function prediction problem to a language translation problem and applies a neural machine translation model for protein function prediction.

연구 동기 및 목표

  • 사용 가능한 단백질 서열의 수가 급격히 증가함에 따라 실험적으로 annotation된 기능의 수와의 격차가 커지는 문제를 해결하기 위해.
  • 외부 데이터베이스나 특징에 의존하지 않고 아미노산 서열에서 직접 단백질 기능을 예측하는 새로운 딥러닝 접근법을 개발하기 위해.
  • 단백질 기능 예측을 신경 기계 번역 문제로 재정의하는 것이 가능한지 탐색하기 위해.
  • 실세계 벤치마크, 특히 CAFA 3 및 경쟁 후 데이터셋에서 제안된 방법의 성능을 평가하기 위해.
  • 기존 최고 수준의 방법들과의 성능 비교를 통해 향후 개선이 필요한 분야를 규명하기 위해.

제안 방법

  • 약 50만 개의 단백질 서열을 기반으로 k=3에서 5까지의 k-mer 빈도를 바탕으로 새로운 단백질 서열 언어인 ProLan을 도입하며, 각 k-mer를 토큰으로 인코딩한다.
  • 유전자 온톨로지(GO) 어휘는 GO 방향 비순환 그래프의 계층적 관계를 유지하는 방식으로 최대 4자리 문자로 표현되는 언어 공간인 GOLan으로 인코딩된다.
  • 순환 신경망(RNN) 기반의 시퀀스-투-시퀀스 신경 기계 번역 모델을 사용하여 ProLan 서열을 GOLan 어휘로 번역하도록 훈련한다.
  • 모델은 어휘 기반 메커니즘을 사용하며, 서열 길이의 변동성을 관리하기 위해 버킷 기반 기법을 적용하여 단백질 서열-GO 어휘 쌍으로 끝내기로 훈련된다.
  • 표준 NMT와 확장된 NMT 변형을 조합하여 다중 레이블 예측 작업에서의 성능을 향상시킨다.
  • 표준 평가 지표인 임계값 기반 및 상위 n개 GO 유사도를 사용하여 성능을 평가하며, SMISS, DeepGO, FANN-GO 및 기타 최고 수준의 모델과의 비교를 수행한다.

실험 결과

연구 질문

  • RQ1단백질 서열 언어와 기능 어휘 언어 사이의 신경 기계 번역 작업으로 단백질 기능 예측을 효과적으로 재정의할 수 있는가?
  • RQ2전통적인 다중 레이블 분류 및 확률 기반 모델과 비교할 때, 시퀀스-투-시퀀스 NMT 모델의 단백질 기능 예측 성능는 어떠한가?
  • RQ3k-mer 빈도와 GO 어휘 인코딩을 사용할 경우 번역 기반 예측에서 생물학적 의미가 얼마나 잘 유지되는가?
  • RQ4실세계 벤치마크, 특히 CAFA 3 및 경쟁 후 데이터셋에서 ProLanGO의 성능는 최고 수준의 방법들과 비교해 어떻게 나타나는가?
  • RQ5특히 상위 GO 어휘 예측 순위에서의 현재 모델의 한계는 무엇인가?

주요 결과

  • ProLanGO는 CAFA 3 테스트 세트에서 표준 NMT 및 확장된 NMT 모델보다 정밀도와 재현율 모두에서 더 뛰어난 성능을 보였다.
  • 특히 임계값 0.10에서 0.80 사이에서는 DeepGO 모델과 유사한 성능을 보였다.
  • 임계값이 0.10 이상일 경우 FANN-GO가 ProLanGO를 능가하여 상위 1개 GO 어휘 예측에서의 향상 여지를 시사한다.
  • SMISS 모델의 SEQ 점수를 능가함으로써 기존 기준 모델 대비 우수한 성능을 입증하였다.
  • 상위 1개 GO 어휘 예측에서는 성능이 열악한 편이었으며, 이는 RNN 출력에 명시적인 순위 정보가 없기 때문일 것으로 보이며, 향후 어휘 순서 정렬 개선이 필요하다는 점을 시사한다.
  • 최고 수준의 동형 기반 방법에 비해 성능가능성이 떨어지지만, 향후 교차 검증, 더 큰 k-mer 크기, 생물학적으로 의미 있는 서열 분할 방법 등으로 정확도 향상이 기대된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.