Skip to main content
QUICK REVIEW

[논문 리뷰] DeepSF: deep convolutional neural network for mapping protein sequences to folds

Jie Hou, Badri Adhikari|arXiv (Cornell University)|2017. 06. 04.
Protein Structure and Dynamics참고 문헌 32인용 수 10
한 줄 요약

DeepSF는 단백질 서열을 직접 1195개의 알려진 접힘 구조 중 하나로 매핑하는 1D 컨volution 신경망을 소개한다. 기존의 템플릿 기반 방법을 회피하며, SCOP1.75에서 80.4%의 정확도와 SCOP2.06에서 77.0%의 정확도를 기록하여, 접힘 인식 과제에서 HHSearch를 4.5–29.1% 뛰어넘으며, 서열 변동에 대해 강건한 특징 추출 능력을 보인다.

ABSTRACT

Motivation Protein fold recognition is an important problem in structural bioinformatics. Almost all traditional fold recognition methods use sequence (homology) comparison to indirectly predict the fold of a tar get protein based on the fold of a template protein with known structure, which cannot explain the relationship between sequence and fold. Only a few methods had been developed to classify protein sequences into a small number of folds due to methodological limitations, which are not generally useful in practice. Results We develop a deep 1D-convolution neural network (DeepSF) to directly classify any protein se quence into one of 1195 known folds, which is useful for both fold recognition and the study of se quence-structure relationship. Different from traditional sequence alignment (comparison) based methods, our method automatically extracts fold-related features from a protein sequence of any length and map it to the fold space. We train and test our method on the datasets curated from SCOP1.75, yielding a classification accuracy of 80.4%. On the independent testing dataset curated from SCOP2.06, the classification accuracy is 77.0%. We compare our method with a top profile profile alignment method - HHSearch on hard template-based and template-free modeling targets of CASP9-12 in terms of fold recognition accuracy. The accuracy of our method is 14.5%-29.1% higher than HHSearch on template-free modeling targets and 4.5%-16.7% higher on hard template-based modeling targets for top 1, 5, and 10 predicted folds. The hidden features extracted from sequence by our method is robust against sequence mutation, insertion, deletion and truncation, and can be used for other protein pattern recognition problems such as protein clustering, comparison and ranking.

연구 동기 및 목표

  • 서열 정렬이나 템플릿 매칭에 의존하지 않고 단백질 서열을 알려진 접힘으로 직접 분류하는 것.
  • 유사성과 템플릿 구조에 의존하는 전통적인 접힘 인식 방법의 한계를 극복하는 것.
  • 원시 단백질 서열에서 접힘 관련 특징을 직접 학습할 수 있는 딥러닝 모델을 개발하는 것.
  • 특히 템플릿 기반 및 어려운 템플릿 기반 모델링 상황에서의 접힘 인식 정확도를 향상시키는 것.
  • 더 넓은 단백질 패턴 인식 응용 분야를 위해 변형에 강건한 특징을 생성하는 것.

제안 방법

  • 임의의 길이를 가진 단백질 서열에서 계층적인 특징을 추출하기 위해 1D 컨volution 신경망(CNN)을 훈련한다.
  • 학습된 컨볼루션 필터를 사용해 아미노산 서열을 처리하여 접힘 클래스를 예측하는 데 유용한 국소적 및 전반적 패턴을 탐지한다.
  • 특징은 풀링되어 완전히 연결된 레이어를 거쳐 1195개의 SCOP 정의 접힘 중 하나를 예측한다.
  • 엔드 투 엔드로 SCOP1.75의 정제된 데이터셋을 사용하여 교차 엔트로피 손실과 확률적 경사 하강법을 사용해 네트워크를 훈련한다.
  • 서열 돌연변이, 삽입, 삭제, 단절에 대한 강건성을 평가하기 위해 학습된 특징의 이식성(transferability)을 검토한다.
  • CASP9–12 타겟에서 HHSearch와의 성능 비교를 통해 벤치마킹을 수행하며, 템플릿 기반 및 템플릿 없는 예측 과제 모두를 포함한다.

실험 결과

연구 질문

  • RQ1딥러닝 모델이 서열 정렬이나 알려진 템플릿에 의존하지 않고 단백질 서열을 접힘으로 직접 분류할 수 있는가?
  • RQ2제안된 방법의 성능은 HHSearch와 같은 최신 프ofile-프ofile 정렬 방법과 비교해 접힘 인식에서 어떻게 나타나는가?
  • RQ3학습된 특징이 생물학적으로 관련된 서열 변동에 얼마나 강건한가?
  • RQ4추출된 특징은 클러스터링 및 랭킹과 같은 다른 단백질 패턴 인식 과제로 일반화될 수 있는가?
  • RQ5더 새로운 SCOP 버전의 독립 테스트 세트에서 모델의 정확도는 얼마인가?

주요 결과

  • DeepSF는 SCOP1.75 데이터셋에서 80.4%의 분류 정확도를 기록하여 대규모 접힘 분류 과제에서 강력한 성능을 보였다.
  • SCOP2.06의 독립 테스트 세트에서 모델은 77.0%의 높은 정확도를 유지하여 더 새로운 데이터에 대한 양호한 일반화 능력을 보였다.
  • CASP9–12의 템플릿 없는 모델링 타겟에서 DeepSF는 상위 1 접힘 인식 정확도에서 HHSearch를 14.5%에서 29.1%까지 뛰어넘었다.
  • 어려운 템플릿 기반 모델링 타겟에서 DeepSF는 상위 1, 상위 5, 상위 10 예측에서 HHSearch보다 4.5%에서 16.7%까지 정확도를 향상시켰다.
  • DeepSF가 추출한 은닉 특징은 서열 돌연변이, 삽입, 삭제, 단절에 대해 강건하여 후속 작업에서 신뢰성 있게 사용될 수 있다.
  • 모델이 학습한 표현은 접힘 인식 이외의 과제인 단백질 클러스터링, 비교, 랭킹 등에서도 이식 가능하고 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.