Skip to main content
QUICK REVIEW

[논문 리뷰] Motif Identification using CNN-based Pairwise Subsequence Alignment Score Prediction

Ethan Jacob Moyer, Anup Das|arXiv (Cornell University)|2021. 01. 21.
Genomics and Phylogenetic Studies참고 문헌 25인용 수 4
한 줄 요약

이 논문은 DNA k-머와 모티프 패턴 간의 쌍별 정렬 점수를 예측하는 1D CNN 모델을 제안하며, Jaccard 지수를 기반으로 한 새로운 $S_{\theta}$ 지표를 사용해 모티프 위치 정확도를 평가한다. 가장 청소된 데이터셋에서 모델은 1bp 스타일로 상위 15개 모티프 식별 정확도가 99.3%에 도달하여 생물학적으로 관련성이 있는 조절 영역를 정밀하게 탐지함을 보여준다.

ABSTRACT

A common problem in bioinformatics is related to identifying gene regulatory regions marked by relatively high frequencies of motifs, or deoxyribonucleic acid sequences that often code for transcription and enhancer proteins. Predicting alignment scores between subsequence k-mers and a given motif enables the identification of candidate regulatory regions in a gene, which correspond to the transcription of these proteins. We propose a one-dimensional (1-D) Convolution Neural Network trained on k-mer formatted sequences interspaced with the given motif pattern to predict pairwise alignment scores between the consensus motif and subsequence k-mers. Our model consists of fifteen layers with three rounds of a one-dimensional convolution layer, a batch normalization layer, a dense layer, and a 1-D maximum pooling layer. We train the model using mean squared error loss on four different data sets each with a different motif pattern randomly inserted in DNA sequences: the first three data sets have zero, one, and two mutations applied on each inserted motif, and the fourth data set represents the inserted motif as a position-specific probability matrix. We use a novel proposed metric in order to evaluate the model's performance, $S_α$, which is based on the Jaccard Index. We use 10-fold cross validation to evaluate out model. Using $S_α$, we measure the accuracy of the model by identifying the 15 highest-scoring 15-mer indices of the predicted scores that agree with that of the actual scores within a selected $α$ region. For the best performing data set, our results indicate on average 99.3% of the top 15 motifs were identified correctly within a one base pair stride ($α= 1$) in the out of sample data. To the best of our knowledge, this is a novel approach that illustrates how data formatted in an intelligent way can be extrapolated using machine learning.

연구 동기 및 목표

  • 딥러닝을 사용해 DNA k-머와 모티프 패턴 간의 쌍별 정렬 점수를 예측함으로써 유전자 조절 영역 내 모티프 식별을 향상시키기.
  • 변동하는 돌연변이 빈도와 확률적 모티프 표현 방식을 가진 서열에서 생물학적으로 의미 있는 모티프를 탐지하는 과제를 해결하기.
  • 상위 스코어링 k-머의 위치 정확도를 캡처하는 새로운 평가 지표 $S_{\alpha}$를 개발하여 회귀 과제에서 표준 MSE의 한계를 극복하기.
  • 지능적인 데이터 포맷팅이 복잡하거나 변형된 모티프를 포함한 경우에도 1D CNN을 사용해 효과적으로 모티프 패턴을 외삽할 수 있음을 보여주기.

제안 방법

  • 15층의 1D CNN 아키텍처는 k-머 서열과 모티프 패턴이 번갈아 가며 배치된 데이터를 처리하기 위해 3라운드의 1D 컨볼루션, 배치 정규화, 밀집층, 1D 최대 풀링을 사용한다.
  • 모델은 네 개의 합성 데이터셋에서 평균 제곱오차(MSE) 손실을 사용해 훈련된다: 돌연변이가 없는 경우, 한 개의 돌연변이가 있는 경우, 두 개의 돌연변이가 있는 경우, 그리고 위치 특이적 확률 행렬(PPM)을 사용한 경우.
  • 각 데이터 샘플은 1,000bp 서열에서 추출된 986개의 겹치는 15-머로 구성되며, 정렬 점수는 BioPython의 로컬 정렬 알고리즘을 통해 계산된다.
  • $S_{\alpha}$ 지표는 상위 15개 예측된 15-머 인덱스와 실제 모티프 위치 인덱스 간의 Jaccard 유사도를 측정함으로써 모델 성능을 평가한다. 이는 $\alpha$-bp 창 내에서 이루어진다.
  • 외부 샘플 성능을 평가하기 위해 10겹 교차검증이 사용되어 다양한 모티프 패턴과 돌연변이 수준에서의 강건성을 확보한다.

실험 결과

연구 질문

  • RQ1모티프가 변형되거나 확률적으로 표현된 경우에도 1D CNN이 DNA k-머와 모티프 패턴 간의 쌍별 정렬 점수를 효과적으로 예측할 수 있는가?
  • RQ2$S_{\alpha}$ 지표는 정규 회귀 지표인 MSE에 비해 모티프 위치 정확도 평가에서 어떻게 향상되는가?
  • RQ3모티프 복잡성이 증가함에 따라, 예를 들어 다수의 돌연변이나 PPM 표현 방식이 있을 경우 모델 성능은 어느 정도 저하되는가?
  • RQ4모티프 빈도가 각 서열마다 변할 경우에도 모델은 상위 15개 스코어링 15-머를 높은 정밀도로 식별하는가?

주요 결과

  • 돌연변이가 전혀 없는 가장 청소된 데이터셋에서 모델은 평균 $S_{1}$ 점수 99.3%를 기록하여, 상위 15개 예측된 15-머 중 99.3%가 1bp 이내의 스트라이드 범위에서 실제 모티프 위치와 정확히 일치함을 나타낸다.
  • $S_{\alpha}$ 지표는 $\alpha$가 증가함에 따라 단조적으로 증가함을 보여, 약간의 오차 여유를 허용함으로써 재현율을 높일 수 있으나 정밀도를 희생시키지 않는다는 점을 시사한다.
  • PPM 기반 데이터셋에서 성능이 크게 저하되어, 확률적 모티프 패턴은 결정론적 또는 변형된 공통 모티프보다 탐지하기 더 어려운 것으로 나타났다.
  • 모델의 정확도는 $\alpha = 5$ 이후에 정체됨을 보여, 이 범위를 초월하면 정확한 모티프 위치 식별에 대한 추가 오차 여유가 성능 향상에 미치는 기여가 점점 줄어듦을 의미한다.
  • 특히 순위와 위치가 점수 회귀보다 더 중요하게 작용하는 고정밀도 모티프 탐지 과제에서는 $S_{\alpha}$ 지표가 MSE보다 더 효과적으로 위치 정확도를 캡처하는 데 유용하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.