Skip to main content
QUICK REVIEW

[論文レビュー] Characterising the D2 statistic: word matches in biological sequences

Sylvain Forêt, Susan R. Wilson|ArXiv.org|Sep 8, 2009
RNA and protein synthesis mechanisms参考文献 24被引用数 6
ひとこと要約

本稿では、生物学的配列における近似語マッチを測定する D₂統計量について、一様および非一様な文字分布下での正確な分散計算と精度の高い分布近似を提供する。t ≥ 0 の不一致を含む理論的特徴付けの拡張により、D₂ の整合性のある統計的利用が可能となり、アラインメントフリーな配列比較、データベース検索、および高精度な cis-Regulatory モジュールの同定が実現される。

ABSTRACT

Word matches are often used in sequence comparison methods, either as a measure of sequence similarity or in the first search steps of algorithms such as BLAST or BLAT. The D2 statistic is the number of matches of words of k letters between two sequences. Recent advances have been made in the characterisation of this statistic and in the approximation of its distribution. Here, these results are extended to the case of approximate word matches. We compute the exact value of the variance of the D2 statistic for the case of a uniform letter distribution, and introduce a method to provide accurate approximations of the variance in the remaining cases. This enables the distribution of D2 to be approximated for typical situations arising in biological research. We apply these results to the identification of cis-regulatory modules, and show that this method detects such sequences with a high accuracy. The ability to approximate the distribution of D2 for both exact and approximate word matches will enable the use of this statistic in a more precise manner for sequence comparison, database searches, and identification of transcription factor binding sites.

研究の動機と目的

  • 近似語マッチ(最大 t 個の不一致を許容)を含む D₂ 統計量の理論的特徴付けを拡張すること。
  • 一様文字分布下での D₂ の正確な分散を計算し、非一様ケースに対して精度の高い近似を提供すること。
  • アラインメントフリーな配列比較、データベース検索、およびリグレラトリ要素検出における D₂ の統計的に妥当な応用を可能にすること。
  • 実際の生物学的配列データを用いた cis-Regulatory モジュール検出への応用を通じて、手法の性能を検証すること。

提案手法

  • 近似語マッチの D₂ 分散の理論的導出を簡略化するため、周期的境界条件を用いる。
  • 重複する語ペアの共分散を分解し、相対的位置に基づいて異なるケース(I–VI)に依存性の近傍を分割する。
  • 重なり合う文字ペアの不交差部分集合を用いた確率的要因分解を活用し、ジグザグな重なり構造における独立性を活かして、同時マッチ確率を要因分解する。
  • 一様分布下での正確な分散公式を導出し、非一様(ベルヌーイ対称)分布下では近似を構築する。
  • 生物学的に妥当な条件下で、D₂ の完全なサンプリング分布を平均と分散を用いて近似する。
  • シミュレーションおよび実ゲノム配列における cis-Regulatory モジュール検出への応用を通じて、手法の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1一様文字分布下での近似語マッチ(最大 t 個の不一致を許容)における D₂ 統計量の正確な分散は何か?
  • RQ2非一様(例:ベルヌーイ対称)生物学的配列モデル下で、D₂ の分散および分布をどのように精度よく近似できるか?
  • RQ3D₂ の改善された統計的特徴付けは、cis-Regulatory モジュールのような機能的非コーディング領域の検出を向上させ得るか?
  • RQ4異なる語長および不一致閾値(t)は、配列比較における D₂ の統計的パワーにどのように影響するか?
  • RQ5周期的境界条件は、線形配列と比較して、理論的分散近似の正確性にどの程度影響を及ぼすか?

主な発見

  • 一様文字分布および最大 t 個の不一致を許容する近似語マッチを想定した場合、D₂ 統計量の正確な分散が導出された。
  • 非一様分布(ベルヌーイ対称)下では、ケース別共分散分解に基づき、D₂ 分散の精度の高い近似が提供された。
  • 典型的な生物学的状況下で、D₂ の分布は高精度に近似可能であることが示され、p 値推定および統計的仮説検定が可能となった。
  • 本手法は、cis-Regulatory モジュールの検出において高い精度を達成し、機能ゲノム研究における厳密な D₂ 統計の実用的有用性を示した。
  • 重なり構造における不交差文字部分集合の確率的独立性により、多くの重なり構成において語マッチインジケータ間の共分散がゼロであることが示され、分散計算が簡素化された。
  • 理論的枠組みは、アラインメントフリーな配列解析において、経験的閾値の代わりに信頼性があり統計的に裏付けられた D₂ の使用を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。