Skip to main content
QUICK REVIEW

[논문 리뷰] Faster exact Markovian probability functions for motif occurrences: a DFA-only approach

Paolo Ribeca, Emanuele Raineri|arXiv (Cornell University)|2008. 01. 24.
Algorithms and Data Compression참고 문헌 11인용 수 6
한 줄 요약

이 논문은 유전적 서열에서 모티프 발생의 마르코프 확률 분포를 정확하게 계산하기 위한 새로운 방법을 제시한다. 이 방법은 유한 상태 기계(Finite Markov Chain Imbedding, FMCI)를 사용하지 않고 오직 결정적 유한 자동기(DFA)만을 사용한다. 이 방법은 이전의 정확한 방법보다 훨씬 빠른 성능을 보이며, 많은 경우에서 근사 방법조차도 앞서는 성능을 보여, 인간 X 염색체나 효모 전사 인자 결합 부위와 같은 큰 게놈의 실질적인 정확한 분석을 가능하게 한다.

ABSTRACT

Background: The computation of the statistical properties of motif occurrences has an obviously relevant practical application: for example, patterns that are significantly over- or under-represented in the genome are interesting candidates for biological roles. However, the problem is computationally hard; as a result, virtually all the existing pipelines use fast but approximate scoring functions, in spite of the fact that they have been shown to systematically produce incorrect results. A few interesting exact approaches are known, but they are very slow and hence not practical in the case of realistic sequences. Results: We give an exact solution, solely based on deterministic finite-state automata (DFAs), to the problem of finding not only the p-value, but the whole relevant part of the Markovian probability distribution function of a motif in a biological sequence. In particular, the time complexity of the algorithm in the most interesting regimes is far better than that of Nuel (2006), which was the fastest similar exact algorithm known to date; in many cases, even approximate methods are outperformed. Conclusions: DFAs are a standard tool of computer science for the study of patterns, but so far they have been sparingly used in the study of biological motifs. Previous works do propose algorithms involving automata, but there they are used respectively as a first step to build a Finite Markov Chain Imbedding (FMCI), or to write a generating function: whereas we only rely on the concept of DFA to perform the calculations. This innovative approach can realistically be used for exact statistical studies of very long genomes and protein sequences, as we illustrate with some examples on the scale of the human genome.

연구 동기 및 목표

  • 생물학적 서열에서 모티프 발생의 전체 마르코프 확률 분포를 계산하는 데 있어 계산적으로 효율적이고 정확한 방법을 개발하는 것.
  • 기존의 정확한 방법들이 실제 게놈 규모의 분석에 너무 느려서 발생하는 한계를 극복하는 것.
  • FMCI나 생성 함수에 의존하지 않고 오직 DFA만을 핵심 계산 엔진으로 사용함으로써 이를 제거하는 것.
  • 정확한 근사 방법이 비판적인 영역에서 체계적으로 실패하는 데서 비롯되는 문제를 해결하기 위한 신뢰할 수 있는 기준을 제공하는 것.
  • 인간 X 염색체나 S. cerevisiae와 같은 큰 게놈에서 과도하거나 부족하게 나타나는 모티프에 대한 정확한 통계 분석을 가능하게 하는 것.

제안 방법

  • 주어진 모티프가 서열에서 인식되고 세어지는 것을 인식하는 결정적 유한 자동기(DFA)를 구성하는 것.
  • DFA의 상태 전이를 이용해 m차 마르코프 모델 하에서 모티프 발생의 마르코프 과정을 모델링하는 것.
  • DFA 상태에 대한 동적 프로그래밍을 통해 모티프 수의 정확한 확률 분포를 계산하는 것.
  • DFA의 구조에서 직접 전이 행렬을 유도함으로써 FMCI를 피하고 중간 단계의 마르코프 체인 통합 과정을 생략하는 것.
  • 특히 저차수 마르코프 모델(m ≤ 3)에 대해 효율적인 상태 수의 나열과 메모리 관리를 통해 알고리즘을 최적화하는 것.
  • 다양한 모티프 유형과 게놈 규모에서 p-값, z-값, 전체 분포 함수를 계산하기 위해 이 방법을 적용하는 것.

실험 결과

연구 질문

  • RQ1오직 DFA 기반의 방법이 기존의 정확한 방법보다 빠르게 모티프 발생의 정확한 마르코프 확률 분포를 계산할 수 있는가?
  • RQ2정확도와 속도 측면에서 대규모 이탈 및 가우시안 근사와 같은 근사 방법보다 DFA 전용 접근법이 뛰어나게 되는가?
  • RQ3이 방법을 사용해 인간 X 염색체와 같은 큰 게놈(예: 인간 X 염색체)에서 모티프 발생의 정확한 통계 분석을 수행하는 것이 가능한가?
  • RQ4이 방법의 성능이 모티프 길이, 알파벳 크기, 마르코프 모델의 순서에 따라 어떻게 변화하는가?
  • RQ5어떤 매개변수 영역에서 이 방법이 근사 알고리즘의 성능을 능가하거나 이를 충족하는가?

주요 결과

  • DFA 전용 방법은 인간 X 염색체(L ~ 1.5×10⁸)와 S. cerevisiae(L ~ 1.2×10⁷)와 같은 실제 게놈 규모에서 모티프 발생의 정확한 확률 분포를 계산할 수 있으며, 이는 이전에 FMCI 기반 정확한 방법으로는 불가능했던 영역이다.
  • m ≤ 2인 모티프에 대해서는 표 2와 그림 7에서 보듯이, 대규모 이탈 및 가우시안 FMCI 근사 방법보다 속도와 정확도에서 항상 뛰어나다.
  • m=2일 때 인간 X 염색체의 320개의 3- 및 4-글자 패턴을 분석하는 데 약 5시간이 소요되어 전체 게놈 분석의 가능성을 입증한다.
  • HIV 및 B. subtilis 게놈에서의 벤치마킹을 통해 많은 경우에서 근사적인 가우시안 FMCI 모델보다 빠른 것으로 확인되었다(표 2).
  • 모든 테스트된 모델에서 정확하고 신뢰할 수 있는 성능을 유지하며, 특히 근사 방법이 실패하는 고z-값 영역에서 근사 방법 평가를 위한 견고한 기준을 제공한다.
  • m ≥ 4일 경우, 상태 수 s = a^m + ℓ - 1 - m에서 나타나는 과도한 메모리 및 계산 비용으로 인해 이 방법은 실용성이 떨어진다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.