Skip to main content
QUICK REVIEW

[论文解读] OMXWare, A Cloud-Based Platform for Studying Microbial Life at Scale.

Ed Seabolt, Gowri Nayar|arXiv (Cornell University)|Nov 5, 2019
Genomics and Phylogenetic Studies参考文献 20被引用 4
一句话总结

OMXWare 是一个基于云的、持续更新的关系型数据库,预先计算并存储了来自 200,000 个精心筛选的细菌基因组的基因型-表型关系,支持对 6800 万个基因、5200 万个蛋白质以及 2.39 亿个结构域的亚秒级查询,其功能注释来自基因本体(Gene Ontology)、KEGG、MetaCyc 和 Reactome,与传统方法相比,显著加速了微生物组系统生物学研究。

ABSTRACT

The rapid growth in biological sequence data is revolutionizing our understanding of genotypic diversity and challenging conventional approaches to informatics. Due to increasing availability of genomic data, traditional bioinformatic tools require substantial computational time and creation of ever larger indices each time a researcher seeks to gain insight from the data. To address these challenges, we pre-compute important relationships between biological entities and capture this information in a relational database.The database can be queried across millions of entities and returns results in a fraction of the time required by traditional methods. In this paper, we describeOMXWare, a comprehensive database relating genotype to phenotype for bacterial life. Continually updated,OMXWare today contains data derived from 200,000 curated, self-consistently assembled genomes. The database stores functional data for over 68 million genes, 52 million proteins, and 239 million domains with associated biological activity annotations from GeneOntology, KEGG, MetaCyc, and Reactome. OMXWare maps connections between each biological entity including the originating genome, gene, protein, and protein domain. Various microbial studies, from infectious disease to environmental health, can benefit from the rich data and relationships within OMXWare. We describe the data selection, the pipeline to create and update OMXWare, and developer tools (Python SDK and Rest APIs) which allow researchers to efficiently study microbial life at scale.

研究动机与目标

  • 为应对分析大规模基因组数据集带来的日益增长的计算负担,预先计算关键的生物学关系。
  • 通过将预索引的关系存储在关系型数据库中,将微生物数据分析的查询时间从数小时缩短至几分之一秒。
  • 创建一个可扩展、持续更新的资源,整合来自基因本体(Gene Ontology)、KEGG、MetaCyc 和 Reactome 的功能注释。
  • 通过高效的数据访问,支持包括传染病和环境微生物学在内的多样化微生物研究领域。
  • 为开发者和研究人员提供可访问的工具,包括 Python SDK 和 REST API,以实现对大规模微生物数据的程序化探索。

提出的方法

  • 使用精心筛选、自洽组装的基因组,预先计算基因组、基因、蛋白质及蛋白质结构域之间的生物学关系。
  • 将来自基因本体(Gene Ontology)、KEGG、MetaCyc 和 Reactome 的功能注释存储在集中式关系型数据库中。
  • 实施可扩展的云基础设施,以支持对生物实体的高吞吐量、低延迟查询。
  • 开发 Python SDK 和 REST API,以支持程序化访问并集成到外部工作流中。
  • 使用标准化的数据处理管道,确保数据整理和更新的一致性与可重现性。
  • 在新基因组数据可用时,持续对数据库进行索引和更新。

实验结果

研究问题

  • RQ1如何高效地存储和查询跨越数百万个微生物实体的预计算生物学关系,以加速系统生物学研究?
  • RQ2与传统生物信息学工具相比,集中式云数据库在分析大规模微生物基因组数据时,能在多大程度上减少查询时间?
  • RQ3在管理 200,000 个细菌基因组的基因型-表型映射时,关系型数据库方法的可扩展性和性能如何?
  • RQ4如何一致地整合并大规模查询来自多个来源(基因本体、KEGG、MetaCyc、Reactome)的功能注释?
  • RQ5哪些工具和接口最有效地支持研究人员通过程序化访问大规模探索微生物生命?

主要发现

  • OMXWare 存储并支持对来自 200,000 个精心筛选的细菌基因组的 6800 万个基因、5200 万个蛋白质以及 2.39 亿个蛋白质结构域的关系进行实时查询。
  • 与传统方法需要数小时相比,该平台将查询响应时间缩短至几分之一秒,即使在对数百万个实体进行复杂查询时亦如此。
  • 来自基因本体(Gene Ontology)、KEGG、MetaCyc 和 Reactome 的功能注释已一致地整合并映射到数据库中的生物实体。
  • 系统支持持续更新,确保数据库能随新基因组数据的发布而保持最新。
  • Python SDK 和 REST API 的可用性使得该平台能够无缝集成到微生物研究的计算工作流中。
  • OMXWare 通过提供对全面生物学关系的可扩展、高效访问,促进了传染病、环境微生物学和微生物组系统生物学的大规模研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。