Skip to main content
QUICK REVIEW

[論文レビュー] Fast Algorithms for Reconciliation under Hybridization and Incomplete Lineage Sorting

Yun Yu, Luay Nakhleh|arXiv (Cornell University)|Dec 9, 2012
Algorithms and Data Compression参考文献 35被引用数 3
ひとこと要約

本稿では、ハイブリダイゼーションと不完全な系統選択(ILS)の両方を想定した遺伝子系統-系統ネットワークの整合性解析に対して、計算的に高価なマルチラベル木(MUL-tree)手法の代わりに、祖先的配置(ACs)を用いる高速かつ正確なアルゴリズムを提示する。ACに基づくアプローチにより、実行時間が最大で5桁短縮されつつも正確性を維持でき、複雑なネットワーク的進化的歴史を有する大規模データセットのスケーラブルな解析が可能になる。

ABSTRACT

Reconciling a gene tree with a species tree is an important task that reveals much about the evolution of genes, genomes, and species, as well as about the molecular function of genes. A wide array of computational tools have been devised for this task under certain evolutionary events such as hybridization, gene duplication/loss, or incomplete lineage sorting. Work on reconciling gene tree with species phylogenies under two or more of these events have also begun to emerge. Our group recently devised both parsimony and probabilistic frameworks for reconciling a gene tree with a phylogenetic network, thus allowing for the detection of hybridization in the presence of incomplete lineage sorting. While the frameworks were general and could handle any topology, they are computationally intensive, rendering their application to large datasets infeasible. In this paper, we present two novel approaches to address the computational challenges of the two frameworks that are based on the concept of ancestral configurations. Our approaches still compute exact solutions while improving the computational time by up to five orders of magnitude. These substantial gains in speed scale the applicability of these unified reconciliation frameworks to much larger data sets. We discuss how the topological features of the gene tree and phylogenetic network may affect the performance of the new algorithms. We have implemented the algorithms in our PhyloNet software package, which is publicly available in open source.

研究の動機と目的

  • ハイブリダイゼーションと不完全な系統選択(ILS)の両方を想定した系統ネットワークと遺伝子系統の整合性解析における計算の非現実性を解決すること。
  • すべての可能なアレルマッピングと凝集歴史を列挙する従来のMUL-treeベースの手法が示す指数的実行時間の課題を克服すること。
  • 正確性を保ちつつ、より大きなデータセットや複雑なネットワークのトポロジーにスケーラブルに適応できる効率的で正確なアルゴリズムを開発すること。
  • 遺伝子系統とネットワークのトポロジーが、ハイブリダイゼーションとILS下での整合性解析におけるアルゴリズムのパフォーマンスに与える影響を調査すること。

提案手法

  • MUL-treeマッピングの明示的列挙に代えて、ネットワークの枝を横断する遺伝子系統の歴史をコンパクトに表現する祖先的配置(ACs)を導入する。
  • 系統ネットワーク上で動的計画法を用い、ACを葉から根へと伝搬させ、系統凝集およびリチュレーションイベントを追跡する。
  • 接続ノードで剪定およびマージ戦略を適用して配置の数を削減し、重複または不可能なアレルマッピングを回避する。
  • 最小コストのためには最適な配置のみを追跡することで最小余剰系統数を計算する。確率的解析では、すべての有効なACの和をとり、遺伝子系統の尤度を計算する。
  • 凝集歴史の数よりもACの数が通常ははるかに少ないことを利用し、歴史列挙よりも効率的な手法を実現する。
  • PhyloNet(オープンソースのソフトウェアパッケージ)に実装し、最小コストおよび確率的整合性解析の両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1ハイブリダイゼーションと不完全な系統選択の両方を想定した場合に、遺伝子系統と系統ネットワークの整合性解析をどのように高速化できるか。
  • RQ2遺伝子系統およびネットワークのトポロジー的特徴—例えば凝集位置やリチュレーション依存性—がアルゴリズムのパフォーマンスに与える影響は何か。
  • RQ3祖先的配置(ACs)がMUL-treeベースの列挙に代わって、正確性と顕著な高速化の両方を達成できるか。
  • RQ4リチュレーションノードの下のリーフ数やリチュレーション依存性が、ACベースの整合性解析における実行時間に与える影響は何か。

主な発見

  • ACベースのアルゴリズムは、MUL-treeベースの手法に比べて最大5桁の高速化を達成し、より大きなデータセットの解析を可能にする。
  • 最小コストの整合性解析では、凝集イベントがリチュレーションノードの下で発生する遺伝子系統が、必要な配置数を減らすため、より速く処理される。
  • 確率的整合性解析では、すべての凝集が根の上に必要な遺伝子系統が最も速く処理され、有効な整合性パスが1つだけであるためである。
  • MUL-tree手法における有効なアレルマッピング数は、接続ノードにおけるAC集合の最大サイズに等しく、表現の同等性を確認する。
  • リチュレーションノードの依存性は、特に確率的整合性解析においてAC集合のサイズを著しく増加させ、パフォーマンスの低下を引き起こす。
  • ACベースの手法は、重複するマッピングを回避するだけでなく、高コストな凝集歴史の列挙をコンパクトな配置追跡に置き換えることで、MUL-tree列挙を上回る性能を発揮する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。