Skip to main content
QUICK REVIEW

[論文レビュー] kdetrees: Nonparametric Estimation of Phylogenetic Tree Distributions

Grady Weyenberg, Peter Huggins|arXiv (Cornell University)|Feb 26, 2013
Genomics and Phylogenetic Studies参考文献 63被引用数 7
ひとこと要約

kdetreesは、水平移動、相同性、アラインメントエラーなどのプロセスに起因する異常な遺伝子系統樹を特定するための非パrametricなカーネル密度推定法を提案する。計算量は2次関数的であり、従来手法に比べて効率が高く、精度の損失は最小限である。また、ApicomplexaおよびEpichloëのデータセットにおいて生物学的に有意な異常値を効果的に検出できた。

ABSTRACT

Motivation: While the majority of gene histories found in a clade of organisms are expected to be generated by a common process (e.g. the coalescent process), it is well-known that numerous other coexisting processes (e.g. horizontal gene transfers, gene duplication and subsequent neofunctionalization) will cause some genes to exhibit a history quite distinct from those of the majority of genes. Such "outlying" gene trees are considered to be biologically interesting and identifying these genes has become an important problem in phylogenetics. Results: We propose and implement KDETREES, a nonparametric method of estimating distributions of phylogenetic trees, with the goal of identifying trees which are significantly different from the rest of the trees in the sample. Our method compares favorably with a similar recently-published method, featuring an improvement of one polynomial order of computational complexity (to quadratic in the number of trees analyzed), with simulation studies suggesting only a small penalty to classification accuracy. Application of KDETREES to a set of Apicomplexa genes identified several unreliable sequence alignments which had escaped previous detection, as well as a gene independently reported as a possible case of horizontal gene transfer. We also analyze a set of Epichloe genes, fungi symbiotic with grasses, successfully identifying a contrived instance of paralogy. Availability: Our method for estimating tree distributions and identifying outlying trees is implemented as the R package KDETREES, and is available for download from CRAN.

研究の動機と目的

  • 特定のパラメトリックな木の分布形を仮定せずに、系統樹の分布を推定する非パラメトリック手法の開発。
  • 大多数の分布から著しく逸脱する遺伝子系統樹を同定し、水平遺伝子移動や相同性などの生物学的異常を示唆する。
  • 従来手法よりも計算効率を向上させ、2次関数的複雑度を達成する。
  • 誤ったアラインメント、誤ったアノテーション、誤った系統樹再構築といったバイオインフォマティクスのアーティファクトを検出する強力なツールを提供する。
  • スケーラブルな、ゲノムワイドな系統樹解析を支援するため、多数の遺伝子系統樹における効率的な異常値検出を可能にする。

提案手法

  • 系統樹の空間におけるカーネル密度推定(KDE)を用い、木のトポロジーと枝長の類似性に基づくカーネル関数を定義する。
  • ロビンソン=フーリーズ距離と枝長の差を基に、木固有のカーネルを構築することで、潜在的な系統樹分布の非パラメトリック推定を可能にする。
  • 推定密度に基づいて木をランク付けすることで異常値検出を実施;低い密度は主な分布からの著しい逸脱を示す。
  • アルゴリズムは系統樹の数に対して2次関数的にスケーリングされ、大規模な系統ゲノムデータセットに適している。
  • RパッケージとしてCRANに実装されており、標準的な系統樹解析パイプラインへの統合を支援する。
  • ベイジアン推論からの系統樹の事後分布サンプルに適用可能であり、単一の点推定に依存しない。

実験結果

リサーチクエスチョン

  • RQ1特定のパラメトリックな木の分布形を仮定しない非パラメトリック手法が、効果的に異常な遺伝子系統樹を同定できるか。
  • RQ2提案手法の計算複雑度は従来手法と比較してどうか。分類精度とのトレードオフはどのようなものか。
  • RQ3kdetreesは、実際のゲノムデータセットにおいて、水平遺伝子移動や相同性に起因する生物学的に有意な異常値を検出できるか。
  • RQ4kdetreesは、誤ったアラインメントや誤ったアノテーションといった技術的アーティファクトをどの程度効果的に同定できるか。
  • RQ5同手法は、数千の遺伝子系統樹を含むゲノムワイドな系統ゲノム解析に効率的にスケーリングできるか。

主な発見

  • kdetreesは、ApicomplexaデータセットにおいてSet8遺伝子が最も外れ値であることを効果的に同定した。その後、これは水平遺伝子移動の可能性があると確認された。
  • kdetreesは、従来の手法で検出されなかった、Apicomplexaデータセット内の複数の信頼性の低いアラインメントを同定した。
  • Epichloëデータセットにおいて、kdetreesは相同性に起因するCysD/LolCアラインメントを正しく異常値として同定した。これは、相同性に起因する不一致を検出できる能力を裏付けた。
  • シミュレーション研究により、kdetreesは非パラメトリックであるにもかかわらず、パラメトリック手法と比較してわずかな精度の損失で高い分類精度を維持することが示された。
  • kdetreesは2次関数的計算複雑度を達成し、従来手法の高次の多項式的複雑度に比べて顕著に改善された。
  • kdetreesは、生物学的または技術的レビューを要するシーケンスやアラインメントを浮き彫りにするデータクリーニングツールとしての実用性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。