Skip to main content
QUICK REVIEW

[論文レビュー] Sibelia: A scalable and comprehensive synteny block generation tool for closely related microbial genomes

Ilya Minkin, Anand Patel|arXiv (Cornell University)|Jul 30, 2013
Genomics and Phylogenetic Studies参考文献 16被引用数 14
ひとこと要約

Sibelia は、反復的 de Bruijn グラフを用いて、近縁な微生物ゲノムにおける相同ブロックの生成をスケーラブルかつ包括的に行うツールであり、複数の解像度レベルでゲノム内およびゲノム間の繰り返しを同定可能である。グラフの簡略化によるスレッド処理を回避することで、標準デスクトップ上で 31 *S. aureus* ゲノムを 31 分、59 *E. coli* ゲノムを 107 分で処理する高効率な性能を達成し、階層的で多粒度の相同ブロック表現をサポートする。

ABSTRACT

Comparing strains within the same microbial species has proven effective in the identification of genes and genomic regions responsible for virulence, as well as in the diagnosis and treatment of infectious diseases. In this paper, we present Sibelia, a tool for finding synteny blocks in multiple closely related microbial genomes using iterative de Bruijn graphs. Unlike most other tools, Sibelia can find synteny blocks that are repeated within genomes as well as blocks shared by multiple genomes. It represents synteny blocks in a hierarchy structure with multiple layers, each of which representing a different granularity level. Sibelia has been designed to work efficiently with a large number of microbial genomes; it finds synteny blocks in 31 S. aureus genomes within 31 minutes and in 59 E.coli genomes within 107 minutes on a standard desktop. Sibelia software is distributed under the GNU GPL v2 license and is available at: https://github.com/bioinf/Sibelia Sibelia's web-server is available at: http://etool.me/software/sibelia

研究の動機と目的

  • 比較ゲノム研究や病原体研究において、多数の近縁な微生物ゲノムを効率的に比較する課題に対処すること。
  • 対照的アラインメントの計算的ボトルネックを回避するため、すべてのゲノムペア間での明示的アラインメントを避ける de Bruijn グラフの使用。
  • ゲノム内繰り返しとゲノム間の保存領域の両方を含む、複数の解像度レベルでの相同ブロック検出を可能にすること。
  • 遺伝子アノテーションの不一致による誤差の累積を回避するため、アノテーションのないヌクレオチド配列を直接分析可能にすること。
  • 異なる粒度レベルを要する多様な生物学的応用を満たすために、相同ブロックの階層的表現を提供すること。

提案手法

  • ゲノム繰り返しをモデル化するため、連結されたアノテーションのない微生物ゲノム配列から反復的 de Bruijn グラフを構築する。
  • DRIMM-Synteny にインspired された配列修正アルゴリズムを用いて、別個のスレッド処理ステップを必要とせずにグラフを簡略化する。
  • 頂点が重複する k-mer を表し、辺が遷移を表す de Bruijn グラフ内の非分岐パスとして相同ブロックを同定する。
  • C-Graphs(文字列グラフ)で、異なる k-値における k-mers の類似性に基づいて位置を統合するグルーミングルールを適用し、構造的関係を保持する。
  • 異なる k-値における de Bruijn グラフの理論的関係を活用して、解像度レベル間での一貫性を保証する。
  • 各 k-値(例:k = 15, 25, 50)に対応する異なる粒度レベルを有する複数層の階層的構造で相同ブロックを表現する。

実験結果

リサーチクエスチョン

  • RQ1すべてのゲノムペア間のアラインメントに依存せずに、数100個の近縁な微生物ゲノムに対する相同ブロック検出をスケーラブルに実現する方法は何か?
  • RQ2de Bruijn グラフに基づくアプローチは、別個のスレッド処理ステップを必要とせずに、ゲノム内およびゲノム間の繰り返しを両方検出可能か?
  • RQ3多様な生物学的応用を満たすために、複数の解像度レベルで相同ブロックをどのように表現できるか?
  • RQ4感度と計算効率のバランスを考慮した場合、保存領域を検出するための最適な k-値は何か?
  • RQ5遺伝子アノテーションの不一致による誤差の累積を回避するため、アノテーションのないヌクレオチド配列を直接相同ブロック検出に使用できる範囲はどの程度か?

主な発見

  • Sibelia は標準デスクトップ上で 31 *S. aureus* ゲノムを 31 分、59 *E. coli* ゲノムを 107 分で処理し、高いスケーラビリティを示した。
  • ツールは、1つのゲノム内での繰り返し(ゲノム内繰り返し)と複数のゲノム間で共有される相同ブロック(ゲノム間相同ブロック)を同時に検出できる。
  • 相同ブロックは階層的で多粒度の構造で表現されており、k = 15, 25, 50 などの異なる解像度レベルでの解析が可能である。
  • スレッド処理のボトルネックを回避するため、グラフを直接簡略化する配列修正アルゴリズムを用いることで、他のツールと比較して優位性を発揮する。
  • 理論的分析により、高k-値における de Bruijn グラフの非分岐パスが、低k-値におけるパスに対応することが確認され、解像度間の一貫性が保証された。
  • アノテーションの不一致による誤差の累積を低減するため、生のヌクレオチド配列を直接分析可能にし、遺伝子アノテーションのばらつきに起因する誤差の拡大を防げる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。