Skip to main content
QUICK REVIEW

[論文レビュー] META-pipe - Pipeline Annotation, Analysis and Visualization of Marine Metagenomic Sequence Data

Espen Mikal Robertsen, Tim Kahlke|arXiv (Cornell University)|Apr 14, 2016
Scientific Computing and Data Management参考文献 43被引用数 14
ひとこと要約

META-pipe は、分散コンピューティングおよびストレージリソースを活用して、前処理、アセンブリ、系統分類、機能的アノテーションを統合したスケーラブルでクラウド連携型の海洋メタゲノムデータ分析パイプラインです。Galaxy やスーパーコンピュータインfrastrucure と統合することで、効率的でインタラクティブな可視化とワークフロー実行を可能にし、大規模な海洋メタゲノムプロジェクトにおいて高いパフォーマンスと拡張性を示しています。

ABSTRACT

The marine environment is one of the most important sources for microbial biodiversity on the planet. These microbes are drivers for many biogeochemical processes, and their enormous genetic potential is still not fully explored or exploited. Marine metagenomics (DNA shotgun sequencing), not only offers opportunities for studying structure and function of microbial communities, but also identification of novel biocatalysts and bioactive compounds. However, data analysis, management, storage, processing and interpretation are significant challenges in marine metagenomics due to the high diversity in samples and the size of the marine flagship projects. We provide a new pipeline, META-pipe, for marine metagenomics analysis. It offers pre- processing, assembly, taxonomic classification and functional analysis. To reduce the effort to develop and deploy it, we have integrated existing biological analysis frameworks, and compute and storage infrastructure resources. Our current META-pipe web service provides integration with identity provider services, distributed storage, computation on a Supercomputer, Galaxy workflows, and interactive data visualizations. We have evaluated the scalability and performance of the analysis pipeline. Our results demonstrate how to develop and deploy a pipeline on distributed compute and storage resources, and discusses important challenges related to this process.

研究の動機と目的

  • 高い微生物多様性を示す大規模な海洋メタゲノムデータセットの管理、処理、分析の課題に対処すること。
  • 既存のバイオインフォマティクスフレームワークおよび分散インfrastrucure と統合することで、メタゲノム解析パイプラインのデプロイおよびメンテナンスの複雑さを低減すること。
  • Galaxy ワークフローと分散ストレージを活用して、インタラクティブでスケーラブルかつ再現可能な海洋メタゲノムデータ分析を可能にすること。
  • 機能的および系統的アノテーションをエンドツーエンドで提供することで、新規の微生物機能およびバイオ触媒の発見を支援すること。

提案手法

  • 前処理、配列アセンブリ、系統分類、機能的アノテーションを、確立されたバイオインフォマティクスツールを用いて1つのワークフローに統合する。
  • 高性能計算のためにスーパーコンピュータを活用し、スケーラブルなデータ処理のために分散ストレージを用いる。
  • Web ベースのインターフェースへの安全なアクセスと認証のため、アイデンティティプロバイダーサービスを採用する。
  • 再現可能でモジュラーな分析パイプラインを実現するため、Galaxy ワークフローを統合する。
  • 系統的および機能的プロファイルのリアルタイムな探索を支援するため、インタラクティブなデータ可視化を実装する。
  • 拡張性を考慮して設計されており、新しいツールや分析モジュールの統合が可能である。

実験結果

リサーチクエスチョン

  • RQ1大規模な海洋メタゲノムデータセットの計算およびストレージ要件に対応できるスケーラブルで分散型のパイプラインをどのように設計できるか?
  • RQ2既存のバイオインフォマティクスツールをハイパフォーマンスコンピューティングおよびクラウドストレージと効率的に統合するためのアーキテクチャパターンは何か?
  • RQ3このパイプラインは、メタゲノムデータの再現性、セキュリティ、インタラクティブな探索をどのように支援するか?
  • RQ4実世界の海洋メタゲノムワークロード下で、このパイプラインはどのようなパフォーマンスおよびスケーラビリティ特性を達成するか?
  • RQ5このようなパイプラインは、海洋環境における新規の微生物機能およびバイオ触媒の発見をどのように促進できるか?

主な発見

  • パイプラインは、分散ストレージ、スーパーコンピューティングリソース、Galaxy ワークフローを効果的に統合し、スケーラブルなメタゲノム解析を実現した。
  • META-pipe は、系統的および機能的プロファイルのインタラクティブな可視化をサポートしており、データ解釈を向上させた。
  • システムは高いパフォーマンスとスケーラビリティを示し、大規模な海洋メタゲノムプロジェクトに適している。
  • 既存のフレームワークおよびインfrastrucure の活用により、開発のオーバーヘッドが低減され、保守性が向上した。
  • アイデンティティプロバイダー統合によるセキュアで認証済みのアクセスを実現し、共同研究を支援した。
  • アーキテクチャは拡張可能であり、今後の新しいツールや分析モジュールの統合が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。