Skip to main content
QUICK REVIEW

[論文レビュー] MetaPalette: A $k$-mer painting approach for metagenomic taxonomic profiling and quantification of novel strain variation

David Koslicki, Daniel Falush|arXiv (Cornell University)|Feb 17, 2016
Genomics and Phylogenetic Studies被引用数 4
ひとこと要約

MetaPaletteは、長めのk-mers(k=30,50)を用いて、サンプルのk-mers頻度をリファレンス生物のパレットに一致させるk-mersペインティング手法を導入し、未知の系統レベルの変異を正確に検出・定量可能にする。この手法は、系統的分類プロファイリングにおける最先端の正確性を達成し、仮想生物を含む線形混合モデルにより系統関係を再構築する。既存手法に比べ、顕著に異なる非リファレンス系統の同定に優れている。

ABSTRACT

Metagenomic profiling is challenging in part because of the highly uneven sampling of the tree of life by genome sequencing projects and the limitations imposed by performing phylogenetic inference at fixed taxonomic ranks. We present the algorithm MetaPalette which uses long $k$-mer sizes ($k=30, 50$) to fit a $k$-mer "palette" of a given sample to the $k$-mer palette of reference organisms. By modeling the $k$-mer palettes of unknown organisms, the method also gives an indication of the presence, abundance, and evolutionary relatedness of novel organisms present in the sample. The method returns a traditional, fixed-rank taxonomic profile which is shown on independently simulated data to be one of the most accurate to date. Tree figures are also returned that quantify the relatedness of novel organisms to reference sequences and the accuracy of such figures is demonstrated on simulated spike-ins and a metagenomic soil sample. The software implementing MetaPalette is available at: https://github.com/dkoslicki/MetaPalette. Pre-trained databases are included for Archaea, Bacteria, Eukaryota, and viruses.

研究の動機と目的

  • リファレンスデータベースに存在しない新規で顕著に異なる生物を含むメタゲノムサンプルのプロファイリングという課題に対処すること。
  • 未知の生物のk-mersパレットをモデル化することで、属や種のランクを超えた系統レベルの分類分解能を向上させること。
  • 未知の生物の豊度とリファレンス配列との系統的類縁関係を定量する手法を開発すること。
  • マーカー遺伝子ベースの手法やk-mers頻度アプローチでは、顕著に異なる系統を同定できないという限界を克服すること。
  • LCAベースのマッピングを用いて仮想生物を分類階層に統合する、柔軟で生物学的に根拠のある分類割り当てを提供すること。

提案手法

  • リファレンス生物のゲノムに含まれるすべてのk-mers(k=30,50)を数えることで、各リファレンス生物のk-mersパレットを構築する。
  • メタゲノムサンプルのk-mers構成を、リファレンス生物パレットと、さまざまな遺伝的距離をとる仮想生物パレットの線形混合としてモデル化する。
  • 非負の最小二乗法最適化にTikhonov正則化(Tikhonov係数λ=200)を適用し、各リファレンスおよび仮想生物の豊度を推定する。
  • スパースで非負の解を用いて、サンプルのk-mersプロファイルの最も可能性の高い寄与者を同定する。
  • 分類的割り当てでは、解ベクトルの非ゼロエントリを、最も近いリファレンス生物の最小共通祖先(LCA)にマッピングし、生物学的に意味のあるランク割り当てを可能にする。
  • 複数のk-mersサイズをサポートし、リファレンスデータベース内のすべてのk-mersを活用する。マーカーk-mersや一意k-mersに依存しない。

実験結果

リサーチクエスチョン

  • RQ1長k-mers(k=30,50)を用いたk-mersペインティング手法は、リファレンスデータベースに存在しない新規の系統レベルの変異を正確にメタゲノムプロファイリング可能か?
  • RQ2仮想生物を含む線形混合モデルを用いることで、未知の生物の豊度とリファレンス配列との系統的類縁関係をどの程度正確に定量できるか?
  • RQ3仮想生物を含む線形混合モデルは、固定ランクまたはマーカーに基づく手法に比べ、分類的分解能を向上させるか?
  • RQ4同定された新規生物の系統的類縁関係を正確に再構築できるか、また、信頼性の高い系統樹が得られるか?
  • RQ5シミュレーテッドおよび実メタゲノムデータにおいて、MetaPaletteは顕著に異なる系統を同定・定量する点で、既存手法に比べて優れているか?

主な発見

  • 独立にシミュレートされたデータにおいて、MetaPaletteは、これまでに報告された中で最も正確な分類プロファイルを達成し、既存手法に比べて系統レベル分解能が優れている。
  • スパイクイン実験(50Kのシミュレート読取り)により、リファレンス系統と30%までの遺伝的差異を示す新規生物を正確に検出・定量できた。
  • シミュレーテッド土壌メタゲノムサンプルにおいて、MetaPaletteは系統関係を正確に再構築した。隣接結合木(neighbor-joining trees)は、新規生物とその最も近縁の系統が正しくクラスタリングされる場合、50%以上のブートストラップ支持度を示した。
  • LCAベースの手法により、分類的ランクが正しく割り当てられた。固定ランクとLCAマッピングを組み合わせたハイブリッド手法により、感度と特異度が向上した。
  • ウイルス、細菌、古細菌、真核生物の各門において、MetaPaletteはすべての界にわたって高い正確性を維持し、HMPモックコミュニティスパイクインにおいても新規生物の検出に一貫した性能を示した。
  • 長k-mers(k=50)の使用により、リファレンス生物と系統的に遠く離れた場合でも、高い特異性と系統レベル変異の強固な検出が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。