Skip to main content
QUICK REVIEW

[논문 리뷰] OMXWare, A Cloud-Based Platform for Studying Microbial Life at Scale.

Ed Seabolt, Gowri Nayar|arXiv (Cornell University)|2019. 11. 05.
Genomics and Phylogenetic Studies참고 문헌 20인용 수 4
한 줄 요약

OMXWare는 200,000개의 정제된 박테리아 게놈을 대상으로 유전자형-표현형 관계를 사전 계산하고 저장하는 클라우드 기반의 지속 업데이트되는 관계형 데이터베이스입니다. 이는 유전자가 6800만개, 단백질이 5200만개, 도메인이 2억 3900만개에 달하는 기능적 주석(Gene Ontology, KEGG, MetaCyc, Reactome)을 포함해 밀리초 이내의 쿼리 응답을 가능하게 하여, 기존 방법에 비해 마이크로생물계 시스템 생물학 연구를 크게 가속화합니다.

ABSTRACT

The rapid growth in biological sequence data is revolutionizing our understanding of genotypic diversity and challenging conventional approaches to informatics. Due to increasing availability of genomic data, traditional bioinformatic tools require substantial computational time and creation of ever larger indices each time a researcher seeks to gain insight from the data. To address these challenges, we pre-compute important relationships between biological entities and capture this information in a relational database.The database can be queried across millions of entities and returns results in a fraction of the time required by traditional methods. In this paper, we describeOMXWare, a comprehensive database relating genotype to phenotype for bacterial life. Continually updated,OMXWare today contains data derived from 200,000 curated, self-consistently assembled genomes. The database stores functional data for over 68 million genes, 52 million proteins, and 239 million domains with associated biological activity annotations from GeneOntology, KEGG, MetaCyc, and Reactome. OMXWare maps connections between each biological entity including the originating genome, gene, protein, and protein domain. Various microbial studies, from infectious disease to environmental health, can benefit from the rich data and relationships within OMXWare. We describe the data selection, the pipeline to create and update OMXWare, and developer tools (Python SDK and Rest APIs) which allow researchers to efficiently study microbial life at scale.

연구 동기 및 목표

  • 거대한 게놈 데이터셋을 분석하는 데 발생하는 증가하는 계산 부담을 해결하기 위해 핵심 생물학적 관계를 사전 계산하는 것.
  • 기존 방법이 수시간이 소요되는 마이크로생물 데이터 분석 쿼리 시간을 밀리초 단위로 단축하기 위해 사전 색인화된 관계를 관계형 데이터베이스에 저장하는 것.
  • Gene Ontology, KEGG, MetaCyc, Reactome에서 유래한 기능적 주석을 통합하는 확장성 있고 지속 업데이트되는 자원을 구축하는 것.
  • 효율적인 데이터 접근을 통해 전염병학 및 환경 미생물학을 포함한 다양한 마이크로생물 연구 분야를 지원하는 것.
  • 개발자와 연구자들이 프로그래밍 방식으로 대규모 마이크로생물 데이터를 탐색할 수 있도록 Python SDK와 REST API를 제공하는 것.

제안 방법

  • 정제되고 자기 일관성 있게 조립된 게놈을 기반으로 유전체, 유전자, 단백질, 단백질 도메인 간 생물학적 관계를 사전 계산하는 것.
  • Gene Ontology, KEGG, MetaCyc, Reactome에서 온 기능적 주석을 중앙집중식 관계형 데이터베이스에 저장하는 것.
  • 고처리량, 저지연 쿼리에 대응하기 위해 확장 가능한 클라우드 기반 인프라를 구현하는 것.
  • 프로그래밍 방식의 액세스와 외부 워크플로우에의 통합을 가능하게 하기 위해 Python SDK와 REST API를 개발하는 것.
  • 데이터 정제 및 업데이트의 일관성과 재현 가능성을 보장하기 위해 표준화된 데이터 파이프라인을 사용하는 것.
  • 새로운 게놈 데이터가 공개될 때마다 데이터베이스를 지속적으로 색인화하고 업데이트하는 것.

실험 결과

연구 질문

  • RQ1수백만 개의 마이크로생물 유닛 간 사전 계산된 생물학적 관계를 효율적으로 저장하고 쿼리하여 시스템 생물학 연구를 가속화할 수 있는가?
  • RQ2대규모 마이크로생물 게놈 데이터를 분석할 때, 기존 생물정보학 도구에 비해 중앙집중식 클라우드 기반 데이터베이스가 쿼리 시간을 얼마나 줄일 수 있는가?
  • RQ320만 개의 박테리아 게놈을 대상으로 한 유전자형-표현형 매핑을 관계형 데이터베이스 접근 방식으로 관리할 때의 확장성과 성능는 어떠한가?
  • RQ4Gene Ontology, KEGG, MetaCyc, Reactome와 같은 다수의 소스에서 온 기능적 주석을 일관성 있게 통합하고 대규모로 쿼리할 수 있는가?
  • RQ5연구자가 프로그래밍적 접근을 통해 마이크로생물 생물학을 대규모로 탐색하는 데 가장 효과적인 도구와 인터페이스는 무엇인가?

주요 결과

  • OMXWare는 20만 개의 정제된 박테리아 게놈에서 유전자 6800만개, 단백질 5200만개, 단백질 도메인 2억 3900만개의 관계를 저장하고 실시간으로 쿼리할 수 있습니다.
  • 기존 방법이 수시간이 소요되는 복잡한 쿼리라도 OMXWare는 밀리초 이내의 응답 시간을 제공하여 쿼리 응답 시간을 극도로 단축합니다.
  • Gene Ontology, KEGG, MetaCyc, Reactome에서 온 기능적 주석이 데이터베이스 내 생물학적 유닛에 일관되게 통합되고 매핑되어 있습니다.
  • 지속적인 업데이트를 통해 새로운 게놈 데이터가 공개될 때마다 데이터베이스가 최신 상태를 유지합니다.
  • Python SDK와 REST API의 가용성 덕분에 마이크로생물 연구의 계산 워크플로우에 원활하게 통합할 수 있습니다.
  • OMXWare는 전염병학, 환경 미생물학, 마이크로생물계 시스템 생물학 분야의 대규모 연구를 가능하게 하여 종합적인 생물학적 관계에 대한 확장성 있고 효율적인 액세스를 제공합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.