Skip to main content
QUICK REVIEW

[논문 리뷰] Poisson approximation for search of rare words in DNA sequences

Nicolas Vergne, Miguel Abadi|ArXiv.org|2007. 11. 15.
RNA and protein synthesis mechanisms참고 문헌 28인용 수 4
한 줄 요약

이 논문은 DNA 서열 분석에서 포isson 근사에 대한 새로운 $ψ$-혼합 방법을 제안하며, 단어 발생 횟수에 따라 요소가 인수함수적으로 감소하는 局소 오차 한계를 제공한다. 체인-스타인의 전역 오차 한계와는 달리, 이 방법은 극단적인 유의수준에서 희귀하게 나타나는 과도 또는 저도로 표현된 단어를 정밀하게 탐지할 수 있게 하며, 특히 *E. coli*와 *Haemophilus influenzae*에서 Chi 사이트와 같은 생물학적으로 관련된 모티프를 더 정확하게 식별함을 보여준다.

ABSTRACT

Using recent results on the occurrence times of a string of symbols in a stochastic process with mixing properties, we present a new method for the search of rare words in biological sequences generally modelled by a Markov chain. We obtain a bound on the error between the distribution of the number of occurrences of a word in a sequence (under a Markov model) and its Poisson approximation. A global bound is already given by a Chen-Stein method. Our approach, the psi-mixing method, gives local bounds. Since we only need the error in the tails of distribution, the global uniform bound of Chen-Stein is too large and it is a better way to consider local bounds. We search for two thresholds on the number of occurrences from which we can regard the studied word as an over-represented or an under-represented one. A biological role is suggested for these over- or under-represented words. Our method gives such thresholds for a panel of words much broader than the Chen-Stein method. Comparing the methods, we observe a better accuracy for the psi-mixing method for the bound of the tails of distribution. We also present the software PANOW (available at http://stat.genopole.cnrs.fr/software/panowdir/) dedicated to the computation of the error term and the thresholds for a studied word.

연구 동기 및 목표

  • 희귀 단어 탐지에 있어 포isson 근사의 전역 오차 한계의 한계를 해결하기 위해.
  • 특히 분포의 꼬리에서 발생 횟수에 대한 국소 오차 한계를 제공하는 방법을 개발하기 위해.
  • 伝통적인 방법이 다루지 못하는 매우 낮은 유의수준에서 생물학적으로 중요한 과도 또는 저도로 표현된 단어를 탐지할 수 있도록 하기 위해.
  • 긴 서열이나 고차원 모델에 대해 정확한 마르코프 체인 수를 세는 데 비해 계산 효율성이 높은 대안을 제공하기 위해.
  • 실용적인 생물학적 서열 분석을 위해 전용 소프트웨어 도구 PANOW를 구현하고 검증하기 위해.

제안 방법

  • 마르코프 체인의 $ψ$-혼합 성질을 활용하여 단어 발생 횟수의 포isson 근사에 대한 점별 오차 한계를 유도한다.
  • 단어 $A$의 발생 횟수 $k$에 따라 인수함수적으로 감소하는 국소 오차 항 $\epsilon(A,k)$를 유도한다.
  • 혼합 과정에서의 도착 시간과 재도착 시간에 관한 아바디와 버그네의 이론적 결과를 응용하여 오차 한계를 구성한다.
  • 오차 한계 $|\mathbb{P}(N(A)=k) - \text{Poisson}(t\mathbb{P}(A))| \leq \epsilon(A,k)$ 를 사용하여 과도 또는 저도로 표현된 단어의 유의수준 임계값을 계산한다.
  • 실제 계산을 위해 PANOW 소프트웨어에 이 방법을 구현하며, http://stat.genopole.cnrs.fr/software/panowdir/ 에서 이용 가능하다.
  • 유의수준 $s$ 와 관측 횟수를 평가하여 $ψ$-혼합 방법과 체인-스타인 방법을 비교한다.

실험 결과

연구 질문

  • RQ1국소 오차 한계가 전역 오차 한계보다 DNA 서열 분석에서 희귀 단어 탐지에 더 정확한 성능을 보일 수 있는가?
  • RQ2$ψ$-혼합 방법이 체인-스타인 방법보다 과도 또는 저도로 표현된 단어에 대해 더 날카운 임계값을 제공하는가?
  • RQ3$ψ$-혼합 방법이 체인-스타인 방법이 실패하는 초저유의수준인 $10^{-239}$ 에서도 생물학적으로 관련된 모티프를 탐지할 수 있는가?
  • RQ4오차 항 $\epsilon(A,k)$ 는 $k$ 가 증가함에 따라 어떻게 변화하며, 고신뢰도 탐지에 충분히 빠르게 감소하는가?
  • RQ5표준 방법이 실패할 때, 특히 자기중복성 또는 주기성을 가진 단어에 대해 이 방법이 얼마나 향상된 성능을 보이는가?

주요 결과

  • $ψ$-혼합 방법은 $k$ 에 따라 인수함수적으로 감소하는 국소 오차 한계 $\epsilon(A,k)$ 를 제공하여 정밀한 꼬리 분석이 가능하다.
  • *E. coli* 의 Chi 사이트에 대해 $ψ$-혼합 방법은 $10^{-239}$ 에 이르는 유의수준을 식별할 수 있었고, 체인-스타인 방법은 $0.067726$ 로 제한되었다.
  • *Haemophilus influenzae* 에서 $ψ$-혼합 방법은 736회 발생할 경우 흡입 서열이 과도로 표현됨을 $10^{-224}$ 의 유의수준으로 탐지했고, 체인-스타인 방법은 $s=0.01$ 에서도 통계적 유의성을 확인하지 못했다.
  • 모든 시험 케이스에서 이 방법은 체인-스타인 방법을 능가했으며, 특히 유의수준에 대한 임계값 $u$ 가 더 낮게 나왔다. 유일한 예외는 단어의 주기성이 가정을 위반할 경우였다.
  • *H. influenzae* 의 ggtggtgg 모티프는 $[n/2]$ 보다 작은 주기성을 가지므로 $ψ$-혼합 방법을 적용할 수 없었으며, 이는 이론적 한계를 확인하는 데 기여했다.
  • PANOW 소프트웨어는 오차 항과 유의수준 임계값을 성공적으로 계산하여 고정밀 생물학적 모티프 탐지에 실용적 유용성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.