Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Comparative Metagenomics using Multiset k-mer Counting

Gaëtan Benoit, Pierre Peterlongo|arXiv (Cornell University)|Apr 8, 2016
Gut microbiota and health参考文献 38被引用数 15
ひとこと要約

本論文では、大規模なメタゲノムデータセット全体でマルチセットk-merカウントを用いて複数の生態的距離を計算するスケーラブルなデノボメタゲノム比較手法Simkaを紹介する。この手法により、320億個のリードを含む690個のヒューマンマイクロバイオームプロジェクト(HMP)サンプルを数時間で高速かつ正確かつ包括的に比較可能であり、生物学的構造を保持しながら、リファレンスベースおよびk-merベースの手法を上回り、定量的豊度パターンを捉える能力に優れている。

ABSTRACT

Background. Large scale metagenomic projects aim to extract biodiversity knowledge between different environmental conditions. Current methods for comparing microbial communities face important limitations. Those based on taxonomical or functional assignation rely on a small subset of the sequences that can be associated to known organisms. On the other hand, de novo methods, that compare the whole sets of sequences, either do not scale up on ambitious metagenomic projects or do not provide precise and exhaustive results. Methods. These limitations motivated the development of a new de novo metagenomic comparative method, called Simka. This method computes a large collection of standard ecological distances by replacing species counts by k-mer counts. Simka scales-up today's metagenomic projects thanks to a new parallel k-mer counting strategy on multiple datasets. Results. Experiments on public Human Microbiome Project datasets demonstrate that Simka captures the essential underlying biological structure. Simka was able to compute in a few hours both qualitative and quantitative ecological distances on hundreds of metagenomic samples (690 samples, 32 billions of reads). We also demonstrate that analyzing metagenomes at the k-mer level is highly correlated with extremely precise de novo comparison techniques which rely on all-versus-all sequences alignment strategy or which are based on taxonomic profiling.

研究の動機と目的

  • リファレンスデータベースの不完全さとスケーラビリティの問題に起因する、現在のメタゲノム比較手法が分類群や機能的アサインメントに依存するという制限を解消すること。
  • 正確性や包括性を損なわず、大規模メタゲノムプロジェクトにスケーラブルなデノボ・リファレンスフリー手法を開発すること。
  • 複数のデータセット全体でk-mer頻度を用いて、複数の生態的距離(例:ジャカード、ブレイ・カーティス)を同時に効率的に計算すること。
  • k-merベースの距離が、特にk ≥ 21のとき、分類群距離と強く相関することを示し、生物学的妥当性を検証すること。
  • 新しいサンプルを既存の距離行列に追加できるインクリメンタル解析を可能にする。線形時間での更新により、過去の計算結果を保持できる。

提案手法

  • Simkaは、複数のメタゲノムサンプルを同時に処理するための新規な並列k-merカウント戦略を用いる。
  • 種の数の代わりにk-merの頻度を用いることで、ジャカード、ブレイ・カーティス、ジェンセン・シャノンといった標準的な生態的距離を計算する。これらの距離はk-merに沿って加法的である。
  • k-mer頻度がゲノム豊度と線形関係にあり、k-merがゲノム領域に特異的であることに着目し、コミュニティ比較の信頼性を高める。
  • インクリメンタル計算をサポート:新しいサンプルを追加するには、距離行列の1行のみを再計算すればよく、過去の結果を保持できる。
  • 効率的なデータ構造と並列処理を活用して大規模データに最適化されたアルゴリズムであり、数百万個のリードを含む数百のサンプルの解析が可能である。
  • k = 21をデフォルトとして採用し、分類群距離と高い相関(r > 0.8)を示すことが確認され、生物学的妥当性が保証されている。

実験結果

リサーチクエスチョン

  • RQ1リファレンスデータベースに依存せずに、k-merベースの距離がメタゲノムデータ内の既知の生物学的構造を正確に回復できるか?
  • RQ2マルチセットk-merカウントは、従来の分類群プロファイリングと比較して、コミュニティの多様性や構成をどれほど正確に捉えられるか?
  • RQ3デノボ・リファレンスフリー手法は、数百のサンプルと数兆個のリードを含む大規模メタゲノムプロジェクトにスケーラブルに適用可能か?
  • RQ4異なる生態的距離(例:定性的なジャカード距離 vs. 定量的なブレイ・カーティス距離)は、メタゲノム比較においてそれぞれどのように異なる生物学的インサイトを明らかにするか?
  • RQ5新しいサンプルを追加する際、距離行列全体を再計算せず、インクリメンタルに更新することが可能か?

主な発見

  • Simkaは690個のヒューマンマイクロバイオームプロジェクト(HMP)サンプル(320億個のリード)に対して、数時間で定性的および定量的生態的距離を計算し、高いスケーラビリティを示した。
  • k-merベースの距離(k=21)と分類群距離の間にr > 0.8の相関が確認され、生物学的正確性が裏付けられた。
  • Simkaは、腸内マイクロバイオームの既知の生物学的構造(例:ボルタリウス優勢とプレボテラ属優勢のコミュニティの分離)をPCoAプロットで正確に捉えた。
  • ジェンセン・シャノン距離行列は、身体部位ごとの明確なクラスタリングを示し、特にボルタリウス、プレボテラ、ルミノコッカセア科などの主要な属の相対的豊度が、順序化プロット上に正確にマップされた。
  • Mashはk-merの存在/不在のみを扱うのに対し、Simkaは豊度を考慮した距離(例:ブレイ・カーティス)を用いるため、希少な分類群のシフトといった、定性的手法では捉え損なわれる微細な生物学的シグナルを明らかにした。
  • 既存のSimka解析に新しいサンプルを追加するには、距離行列の1行のみを線形時間で再計算すればよく、効率的なインクリメンタル解析が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。