Skip to main content
QUICK REVIEW

[論文レビュー] Poisson approximation for search of rare words in DNA sequences

Nicolas Vergne, Miguel Abadi|ArXiv.org|Nov 15, 2007
RNA and protein synthesis mechanisms参考文献 28被引用数 4
ひとこと要約

本稿は、DNA配列解析におけるポアソン近似のための新しい$ψ$-ミキシング手法を提案し、語の出現回数に伴い階乗的に減少する局所誤差バウンドを提供する。チェン=スタインのグローバルバウンドとは異なり、本手法は極めて低い有意水準における希少な過剰または不足表現語の正確な検出を可能にし、特に*E. coli*および*Haemophilus influenzae*におけるChiサイトのような生物学的に有意義なモチーフの同定において、優れた精度を示している。

ABSTRACT

Using recent results on the occurrence times of a string of symbols in a stochastic process with mixing properties, we present a new method for the search of rare words in biological sequences generally modelled by a Markov chain. We obtain a bound on the error between the distribution of the number of occurrences of a word in a sequence (under a Markov model) and its Poisson approximation. A global bound is already given by a Chen-Stein method. Our approach, the psi-mixing method, gives local bounds. Since we only need the error in the tails of distribution, the global uniform bound of Chen-Stein is too large and it is a better way to consider local bounds. We search for two thresholds on the number of occurrences from which we can regard the studied word as an over-represented or an under-represented one. A biological role is suggested for these over- or under-represented words. Our method gives such thresholds for a panel of words much broader than the Chen-Stein method. Comparing the methods, we observe a better accuracy for the psi-mixing method for the bound of the tails of distribution. We also present the software PANOW (available at http://stat.genopole.cnrs.fr/software/panowdir/) dedicated to the computation of the error term and the thresholds for a studied word.

研究の動機と目的

  • DNA配列における希少語の検出におけるポアソン近似のグローバル誤差バウンドの限界を解決すること。
  • 語の出現回数に対して局所誤差バウンドを提供する手法の開発、特に分布の尾部におけるもの。
  • 従来の手法では到達できない極めて低い有意水準において、生物学的に有意義な過剰または不足表現語の検出を可能にすること。
  • 長大な配列や高次モデルにおいて、正確なマルコフ連鎖カウントの計算コストの高い代替手段としての計算効率の良い手法の提供。
  • 実用的な生物学的配列解析のための専用ソフトウェアツールPANOWを実装・検証すること。

提案手法

  • マルコフ連鎖の$ψ$-ミキシング性質を活用し、語の出現回数のポアソン近似における点ごとの誤差バウンドを導出する。
  • 語$A$の出現回数$k$とともに階乗的に減少する局所誤差項$\epsilon(A,k)$を導出する。
  • ミキシング過程における到達時間および再訪問時間に関するアバディとベルンの理論的結果を応用して誤差バウンドを構築する。
  • 誤差バウンド$|\mathbb{P}(N(A)=k) - \text{Poisson}(t\mathbb{P}(A))| \leq \epsilon(A,k)$を用いて、過剰または不足表現の有意水準を計算する。
  • PANOWソフトウェアに本手法を実装し、実用的な計算を可能にした(http://stat.genopole.cnrs.fr/software/panowdir/)。
  • 有意水準$s$および観測回数を評価することで、$ψ$-ミキシング手法とチェン=スタイン手法を比較する。

実験結果

リサーチクエスチョン

  • RQ1局所誤差バウンドを用いたポアソン近似は、グローバルバウンドに比べて、DNA配列解析における希少語の検出をより正確に可能にするか?
  • RQ2チェン=スタイン手法に比べ、$ψ$-ミキシング手法は過剰または不足表現語の有意水準をより厳密に推定できるか?
  • RQ3チェン=スタイン手法が失敗するような極めて低い有意水準(例:$10^{-239}$)において、$ψ$-ミキシング手法は生物学的に有意義なモチーフを検出可能か?
  • RQ4誤差項$\epsilon(A,k)$は$k$の増加に伴いどのように変化するか?また、高信頼度での検出を支えるのに十分に速く減少するか?
  • RQ5標準的手法が失敗する状況において、自己重複性や周期性を示す語に対して、本手法はどの程度検出性能を向上させるか?

主な発見

  • $ψ$-ミキシング手法は、$k$とともに階乗的に減少する局所誤差バウンド$\epsilon(A,k)$を提供し、正確な尾部解析を可能にする。
  • *E. coli*におけるChiサイトの例では、$ψ$-ミキシング手法が$10^{-239}$という極めて低い有意水準を特定可能であるのに対し、チェン=スタイン手法は$0.067726$までに制限される。
  • *Haemophilus influenzae*において、$ψ$-ミキシング手法は736回の出現から、有意水準$10^{-224}$で取り込み配列が過剰表現であると検出可能であるが、チェン=スタイン手法は$s=0.01$では有意性を確認できない。
  • すべてのテストケースにおいて、$ψ$-ミキシング手法はチェン=スタイン手法を上回り、有意水準の閾値$u$をより小さく算出するが、語の周期性が仮定を満たさない場合を除く。
  • *H. influenzae*におけるggtggtggモチーフ(周期が$[n/2]$未満)は、$ψ$-ミキシング手法を適用できないことが確認され、理論的限界を裏付ける。
  • PANOWソフトウェアは誤差項および有意水準の閾値を正しく計算でき、高精度な生物学的モチーフ検出における実用的有用性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。