[論文レビュー] OMXWare, A Cloud-Based Platform for Studying Microbial Life at Scale.
OMXWare は、20万個のキュレートされた細菌ゲノムをカバーする、ゲノム型対表現型関係を事前に計算・保存するクラウドベースの継続的更新型リレーショナルデータベースであり、6800万個の遺伝子、5200万個のタンパク質、2億3900万個のドメインについて、Gene Ontology、KEGG、MetaCyc、Reactome からの機能的アノテーションを含め、1秒未塔のクエリを可能にし、従来の方法と比較して微生物システム生物学研究を顕著に加速する。
The rapid growth in biological sequence data is revolutionizing our understanding of genotypic diversity and challenging conventional approaches to informatics. Due to increasing availability of genomic data, traditional bioinformatic tools require substantial computational time and creation of ever larger indices each time a researcher seeks to gain insight from the data. To address these challenges, we pre-compute important relationships between biological entities and capture this information in a relational database.The database can be queried across millions of entities and returns results in a fraction of the time required by traditional methods. In this paper, we describeOMXWare, a comprehensive database relating genotype to phenotype for bacterial life. Continually updated,OMXWare today contains data derived from 200,000 curated, self-consistently assembled genomes. The database stores functional data for over 68 million genes, 52 million proteins, and 239 million domains with associated biological activity annotations from GeneOntology, KEGG, MetaCyc, and Reactome. OMXWare maps connections between each biological entity including the originating genome, gene, protein, and protein domain. Various microbial studies, from infectious disease to environmental health, can benefit from the rich data and relationships within OMXWare. We describe the data selection, the pipeline to create and update OMXWare, and developer tools (Python SDK and Rest APIs) which allow researchers to efficiently study microbial life at scale.
研究の動機と目的
- 膨大なゲノムデータセットを解析する際の計算負荷の増大に対処するため、主要な生物学的関係を事前に計算すること。
- リレーショナルデータベースに事前にインデックス化された関係を格納することで、微生物データ解析のクエリ時間を小数秒に短縮すること。
- Gene Ontology、KEGG、MetaCyc、Reactome からの機能的アノテーションを統合した、スケーラブルで継続的に更新されるリソースの構築。
- 感染症や環境微生物学を含む多様な微生物研究分野を、効率的なデータアクセスにより支援すること。
- 研究者や開発者が、Python SDK や REST API を通じて、スケーラブルに微生物データをプログラムで探索できるツールを提供すること。
提案手法
- キュレートされ、自己一貫性のあるアセンブリがなされたゲノムを用いて、ゲノム、遺伝子、タンパク質、タンパク質ドメイン間の生物学的関係を事前に計算する。
- Gene Ontology、KEGG、MetaCyc、Reactome からの機能的アノテーションを、中央集権的なリレーショナルデータベースに格納する。
- 高スループットかつ低遅延な生物学的エンティティのクエリをサポートする、スケーラブルなクラウドベースのインfra構築を実装する。
- プログラムによるアクセスと外部ワークフローへの統合を可能にするため、Python SDK と REST API の開発。
- データキュレーションと更新の一貫性と再現可能性を保証するため、標準化されたデータパイプラインの使用。
- 新規ゲノムデータの入手に応じて、データベースの継続的インデックス化と更新。
実験結果
リサーチクエスチョン
- RQ1何百万もの微生物エンティティにわたる事前計算された生物学的関係を、効率的に格納・クエリ可能にする方法は何か? これにより、システム生物学研究がどのように加速されるか?
- RQ2大規模な微生物ゲノムデータを解析する際、従来のバイオインフォマティクスツールと比較して、集中型クラウドベースデータベースがクエリ時間をどの程度短縮できるか?
- RQ320万個の細菌ゲノムにわたるゲノム型対表現型マッピングを管理する際、リレーショナルデータベースアプローチのスケーラビリティとパフォーマンスはいかほどか?
- RQ4Gene Ontology、KEGG、MetaCyc、Reactome といった複数のソースからの機能的アノテーションを、どのように一貫性を保ちつつスケールして統合・クエリ可能にするか?
- RQ5研究者がプログラムによるアクセスを通じて、スケールして微生物の多様性を効果的に探索できるために、最も効果的なツールやインターフェースは何か?
主な発見
- OMXWare は、20万個のキュレートされた細菌ゲノムから得られる6800万個の遺伝子、5200万個のタンパク質、2億3900万個のタンパク質ドメインの関係を格納し、リアルタイムでのクエリを可能にしている。
- 従来の方法が数時間を要するのに対し、OMXWare は数百万エンティティにわたる複雑なクエリであっても、応答時間を小数秒にまで短縮している。
- Gene Ontology、KEGG、MetaCyc、Reactome からの機能的アノテーションが、データベース内での生物学的エンティティに一貫性を保って統合・マッピングされている。
- 継続的な更新が可能であり、新規ゲノムデータの入手に応じてデータベースが最新の状態を維持している。
- Python SDK と REST API の利用により、微生物研究の計算ワークフローへのシームレスな統合が可能になっている。
- 感染症、環境微生物学、微生物システム生物学の分野における大規模な研究を、包括的な生物学的関係へのスケーラブルかつ効率的なアクセスを通じて促進している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。