Skip to main content
QUICK REVIEW

[論文レビュー] MetaScope - Fast and accurate identification of microbes in metagenomic sequencing data

Benjamin Buchfink, Daniel H. Huson|arXiv (Cornell University)|Nov 25, 2015
Genomics and Phylogenetic Studies参考文献 18被引用数 6
ひとこと要約

MetaScopeは、宿主および微生物のリファレンスデータベースに対して迅速に配列リードをマップするための新規DNAアラインナーSASSを用いた、高速かつ高精度なメタゲノム解析ツールである。重み付きLCAアルゴリズムを採用し、正確な系統的分類割り当てと遺伝子予測を実現し、90.1–98.7%の精度を達成。4–13分でデータセットを処理し、2013年DTRAソフトウェアチャレンジで優勝した。

ABSTRACT

MetaScope is a fast and accurate tool for analyzing (host-associated) metagenome datasets. Sequence alignment of reads against the host genome (if requested) and against microbial Genbank is performed using a new DNA aligner called SASS. The output of SASS is processed so as to assign all microbial reads to taxa and genes, using a new weighted version of the LCA algorithm. MetaScope is the winner of the 2013 DTRA software challenge entitled "Identify Organisms from a Stream of DNA Sequences".

研究の動機と目的

  • メタゲノム配列データ内の微生物を、特にバイオテロ検出のような時間的に制限のある状況下でも迅速かつ正確に同定できるツールを開発すること。
  • ウイルス性および合成のGenBankエントリに含まれるヒトに類似した配列が原因で生じる誤検出の系統的分類割り当てを是正すること。
  • ナーブLCAアルゴリズムの限界を克服し、系統的および遺伝子分類の正確性を向上させること。このアルゴリズムは、しばしば広範すぎるまたは非特異的な割り当てをもたらすことがある。
  • Illumina、PacBio、Roche-454、Ion Torrentなどの多様なシーケンシングプラットフォームに対応するため、プラットフォーム固有の誤差率やリード特性に合わせてパラメータを調整することで、パフォーマンスを最適化すること。
  • 高速アラインメントと知的リード割り当て、遺伝子レポートの統合により、大規模メタゲノムデータセットの効率的処理を可能にすること。

提案手法

  • MetaScopeは、スペーシングシード、ハッシュテーブル、並列C++実装を用いる新規DNAアラインナーSASSを採用し、感度を保ちつつアラインメントを高速化する。
  • SASSは利益に基づく終了基準とマイヤーズのビットベクトルアルゴリズムを用い、シードマッチの延長を決定する。これにより、速度と正確性のバランスが取れる。
  • 宿主ゲノムフィルタリングはまずSASSを用いてヒト由来リードを除去し、その後、ウイルス性および合成のGenBank配列内のヒトに類似した領域をマスキングすることで、誤検出を低減する。
  • 新規の重み付きLCAアルゴリズムにより、各リファレンス配列に割り当てられたリード数とその相対的重みを考慮し、合計重みの75%をカバーする系統にリードを割り当てる。
  • 遺伝子割り当ては、リファレンス配列の重みとカバレッジ比に基づき重複する遺伝子をランク付けし、各リードに対して上位ランクの遺伝子のみを報告することで、誤検出の低減を図る。
  • プラットフォーム固有のパラメータを適用する——例としてPacBioには感受性の高いインデックス作成、Illuminaには高いminover閾値を設定——シーケンシング技術の特性に応じたパフォーマンス最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1PacBioのような高誤差率を示すプラットフォームを含め、多様なシーケンシングプラットフォームで高速かつ高精度なメタゲノム解析パイプラインを実現できるか?
  • RQ2非常に類似したリファレンス配列が存在する状況下で、ナーブLCAアルゴリズムが広範すぎるまたは非特異的な系統的分類割り当てを生じる傾向をどのように是正できるか?
  • RQ3ウイルス性および合成のGenBankエントリ内のヒトに類似した配列をマスキングすることで、宿主関連メタゲノムデータセットにおける誤検出の系統的分類割り当てをどの程度低減できるか?
  • RQ4Illumina、Roche-454、Ion Torrent、PacBioプラットフォームからのデータセットを処理する際、感度と特異性のバランスを最適化するためのパラメータ設定は何か?
  • RQ5アラインメント重みとカバレッジ比に基づき遺伝子を優先順位付けする遺伝子予測戦略は、感度を損なわせることなく、誤検出遺伝子報告を顕著に低減できるか?

主な発見

  • MetaScopeは、DTRAチャレンジの9つのデータセットで90.1–98.7%の微生物同定精度を達成し、多様なシーケンシングプラットフォームで高い信頼性を示した。
  • すべてのデータセットを4~13分で処理し、スピード面で既存手法を著しく上回り、チャレンジが求める大幅な高速化要件を満たした。
  • 重み付きLCAアルゴリズムにより、特に多くの類縁リファレンス配列を含むデータセットにおいて、高レベルの系統への過剰割り当てが低減され、系統的分類割り当ての特異性が向上した。
  • 遺伝子スコアは82~100の範囲にあり、いくつかのデータセットでは特に高い99を記録し、重複アラインメントの複雑さにもかかわらず、効果的な遺伝子予測が可能であった。
  • Illuminaではminover閾値0.9、PacBioではtop設定0.1といったプラットフォーム固有のパラメータの適用が、高誤差率データでの高い正確性を維持するために不可欠であった。
  • ウイルス性および合成のGenBankエントリ内のヒトに類似した領域のマスキングにより、誤検出の割り当てが顕著に低減され、系統的および遺伝子分類割り当て全体の信頼性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。