[论文解读] IBM Functional Genomics Platform, A Cloud-Based Platform for Studying Microbial Life at Scale
IBM功能基因组学平台是一个基于云的关系型数据库,预先计算并存储了20万份经筛选的细菌基因组中的基因型-表型关系,支持对6800万个基因、5200万个蛋白质和2.39亿个蛋白质结构域的亚秒级查询。通过利用预标注数据和优化的数据库索引,该平台使大规模微生物分析速度远超传统工具(如BLAST或Bowtie2),后者需为每次新查询重复计算。
The rapid growth in biological sequence data is revolutionizing our understanding of genotypic diversity and challenging conventional approaches to informatics. With the increasing availability of genomic data, traditional bioinformatic tools require substantial computational time and the creation of ever-larger indices each time a researcher seeks to gain insight from the data. To address these challenges, we pre-computed important relationships between biological entities spanning the Central Dogma of Molecular Biology and captured this information in a relational database. The database can be queried across hundreds of millions of entities and returns results in a fraction of the time required by traditional methods. In this paper, we describe extit{IBM Functional Genomics Platform} (formerly known as OMXWare), a comprehensive database relating genotype to phenotype for bacterial life. Continually updated, IBM Functional Genomics Platform today contains data derived from 200,000 curated, self-consistently assembled genomes. The database stores functional data for over 68 million genes, 52 million proteins, and 239 million domains with associated biological activity annotations from Gene Ontology, KEGG, MetaCyc, and Reactome. IBM Functional Genomics Platform maps all of the many-to-many connections between each biological entity including the originating genome, gene, protein, and protein domain. Various microbial studies, from infectious disease to environmental health, can benefit from the rich data and connections. We describe the data selection, the pipeline to create and update the IBM Functional Genomics Platform, and the developer tools (Python SDK and REST APIs) which allow researchers to efficiently study microbial life at scale.
研究动机与目标
- 解决传统生物信息学工作流中存在的计算瓶颈,这些工作流需为每个新基因组数据集重复进行索引和比对。
- 通过经筛选的、自洽组装的基因组,创建一个可扩展的集中式存储库,实现跨多种细菌物种的基因型-表型关联。
- 通过预先计算基因、蛋白质、结构域与表型之间的关系,将大规模微生物分析的查询时间从数小时缩短至亚秒级。
- 提供可编程平台,配备REST API和Python SDK,使研究人员能够构建用于微生物发现的定制化应用。
- 通过维持生物实体之间的持久可更新连接,支持实时数据集成和表型特征签名的发现。
提出的方法
- 平台从公共数据库中摄入并筛选20万份高质量、自洽组装的细菌基因组,确保数据的一致性和质量。
- 采用成熟的生物信息学工作流——包括基因预测、蛋白质翻译和通过InterProScan识别结构域——对基因、蛋白质和功能结构域进行注释。
- 功能注释映射到标准化本体(基因本体、KEGG、MetaCyc、Reactome),并存储在规范化的关系型数据库模式中。
- 系统预先计算并索引所有基因组、基因、蛋白质和结构域之间的多对多关系,以支持快速、复杂的查询。
- 基于云的计算管道耗时超过1000万小时的计算资源,将原始序列数据处理为结构化、可查询的实体。
- 开发者工具(包括Python SDK和REST API)支持程序化访问数据库,并可集成到自定义分析工作流中。
实验结果
研究问题
- RQ1与基于比对的传统工具相比,预计算的关系型数据库是否能显著减少大规模微生物基因组学的查询时间?
- RQ2如何在成千上万种细菌属的尺度上,高效且一致地表示基因型-表型关系?
- RQ3预计算的生物关系在多大程度上能够实现实时发现共现的功能特征(如毒力因子)?
- RQ4云原生平台如何在统一的分析环境中同时支持大规模参考数据和用户上传的微生物序列?
- RQ5一个索引超过2.39亿个蛋白质结构域和6800万个基因、并包含跨实体关系的数据库,在性能和可扩展性方面表现如何?
主要发现
- IBM功能基因组学平台在20万份经筛选的细菌基因组中存储并索引了超过6800万个唯一基因、5200万个唯一蛋白质和2.39亿个唯一蛋白质结构域。
- 该系统可对数亿个生物实体之间的复杂多实体关系实现亚秒级查询响应,远快于传统工具(如BLAST或Bowtie2)。
- 该平台预先计算并维护基因组、基因、蛋白质和结构域之间的持久连接,避免了重复查询时重新计算索引的需要。
- 已构建并部署一个原型毒力特征发现应用作为微服务,使用户能够以极低计算开销识别与致病性相关的共现功能结构域。
- 系统支持实时数据摄入和更新,使新基因组特征可无缝集成,无需重新处理现有数据,确保随着测序数据量增长而具备可扩展性。
- 平台的开发者工具(包括Python SDK和REST API)已被用于构建和部署多种研究领域的定制应用,涵盖传染病和环境微生物学。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。