Skip to main content
QUICK REVIEW

[論文レビュー] Sparse long blocks and the variance of the longest common subsequences in random words

Saba Amsalu, Christian Houdré|arXiv (Cornell University)|Apr 4, 2012
Random Matrices and Applications参考文献 19被引用数 8
ひとこと要約

本稿は、希な長いブロックまたは特異な部分文字列を含むランダムな文字列における最長共通部分列(LCS)の分散を確立し、平均LCS曲線に弱い条件下で、それが文字列長に比例して増加することを証明している。これは、計算生物学で用いられるモデルを含む現実的モデルにおいて線形分散を示すことで、長年の未解決問題を解決したものである。これは、従来の低エントロピー状態に限定された結果を拡張したものである。

ABSTRACT

Consider two independent random strings having same length and taking values uniformly in a common finite alphabet. We study the order of the variance of the length of the longest common subsequences (LCS) of these strings when long blocks, or other types of atypical substrings, are sparsely added into one of them. Under weak conditions on the derivative of the mean LCS-curve, the order of the variance of the LCS is shown to be linear in the length of the strings. We also argue that our proofs carry over to many models used by computational biologists to simulate DNA-sequences. This is the first result where the open question of the order of the fluctuation of the LCS of random strings is solved for a realistic model. Until now, this type of result had only been established for low entropy cases.

研究の動機と目的

  • 希な長いブロックまたは特異な部分文字列を含むランダムな文字列におけるLCS長の漸近的順序を特定すること。
  • 特に計算生物学で用いられるモデルを含む現実的確率モデルにおけるLCSのフラクチュエーションの順序という未解決問題を解明すること。
  • 従来の低エントロピー状態に限定されていた結果を拡張し、平均LCS曲線の微分に関する弱い条件下でも線形分散が成り立つことを示すこと。
  • LCSの長さの分散が線形にスケーリングすることを示す証明が、DNA配列を模倣するモデルに適用可能であることを確立することにより、生物学的配列解析への関連性を高めること。

提案手法

  • 単位長あたりの極限的平均LCSの存在を示すために、部分加法性の議論を用いる。これを γ*ₖ と表記する。
  • 一方の文字列に希な長いブロックまたは特異な部分文字列を追加する摂動を加えた場合のLCS長を分析する。
  • 集中不等式を適用して、LCSスコアの最大偏差を制限し、追加された部分文字列によるLCSの変動が確率的に制御されることを示す。
  • バイアス分解技術を用いて、整列済み文字列ペアと摂動を加えた文字列ペアのLCS長を比較し、追加された部分文字列に起因する期待増加分を分離する。
  • γₖ(n,p) から γₖ(p) への既知の収束速度を活用し、Alexander(1994, 1998)の O(ln n / √n) の誤差バウンドを用いて近似誤差を制御する。
  • LCS成長関数 γₖ(p) の凹型および対称性を活用し、部分文字列を追加した際の期待LCS増加分の下界を導出し、線形分散スケーリングを保証する。

実験結果

リサーチクエスチョン

  • RQ1希な長いブロックまたは特異な部分文字列が導入されたランダムな文字列におけるLCS長の漸近的順序は何か?
  • RQ2低エントロピー状態において観察された線形分散スケーリングは、DNA配列の解析に用いられるようなより現実的なモデルにも拡張可能か?
  • RQ3平均LCS曲線の微分に関する弱い条件下でも、LCSの分散が線形にスケーリングすることを示せるか?
  • RQ4長大なブロックなどの摂動が期待LCS長に与える影響は何か? その影響は、分散挙動を推論するために定量的に測定可能か?
  • RQ5摂動を加えた文字列における分散スケーリングの証明が、生物学的配列を模倣するモデルにどの程度まで適用可能か?

主な発見

  • 平均LCS曲線の微分に関する弱い条件下で、LCS長の分散が文字列長 n に比例して増加すること、すなわち Var(LCₙ) = Θ(n) であることが示された。
  • 本結果により、現実的モデルにおけるランダムな文字列におけるLCSのフラクチュエーションの順序という未解決問題が解決された。これは、従来の低エントロピー状態に限定された結果を拡張したものである。
  • 証明は、計算生物学者がDNA配列を模倣するために用いるモデルに対しても適用可能であり、論文の生物学的関連性を高めている。
  • 長さ r の部分文字列を追加した際の期待LCS長の増加は、下界 r(γₖ(pᵢ)/2 − |γ′(pᵢᵢ−)|/2) + O(√(s+t) ln(s+t)) で抑えられ、線形バイアスが保証される。
  • 測度集中の議論により、確率的揺らぎによるLCSスコアの最大偏差が O(√d ln d) であることが示され、これは非線形であり、全体の線形分散スケーリングに影響しない。
  • 主な技術的貢献は、希な長いブロックが疎に追加されても、分散が線形に増加することを保証する期待LCS増加量の下界を導出したことにある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。