Skip to main content
QUICK REVIEW

[논문 리뷰] Targeting SARS-CoV-2 with AI- and HPC-enabled Lead Generation: A First Data Release

Yadu Babuji, Ben Blaiszik|arXiv (Cornell University)|2020. 05. 28.
Computational Drug Discovery Methods참고 문헌 28인용 수 20
한 줄 요약

이 논문은 SARS-CoV-2 약물 발견을 가속화하기 위해 인공지능과 고성능 계산(HPC)을 활용한 대규모 데이터 릴리스를 제시한다. 이 데이터셋은 분자 지문, 2D 이미지, 2D/3D 기술자표현을 포함한 42억 개 이상의 분자를 포함하고 있으며, 고성능 계산을 통해 생성되어 Globus를 통해 공개적으로 접근 가능하다. 이 데이터셋은 기존 약물 재활용 또는 새로운 항바이러스 제제를 위한 빠른 기계학습 스크리닝을 가능하게 한다.

ABSTRACT

Researchers across the globe are seeking to rapidly repurpose existing drugs or discover new drugs to counter the the novel coronavirus disease (COVID-19) caused by severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2). One promising approach is to train machine learning (ML) and artificial intelligence (AI) tools to screen large numbers of small molecules. As a contribution to that effort, we are aggregating numerous small molecules from a variety of sources, using high-performance computing (HPC) to computer diverse properties of those molecules, using the computed properties to train ML/AI models, and then using the resulting models for screening. In this first data release, we make available 23 datasets collected from community sources representing over 4.2 B molecules enriched with pre-computed: 1) molecular fingerprints to aid similarity searches, 2) 2D images of molecules to enable exploration and application of image-based deep learning methods, and 3) 2D and 3D molecular descriptors to speed development of machine learning models. This data release encompasses structural information on the 4.2 B molecules and 60 TB of pre-computed data. Future releases will expand the data to include more detailed molecular simulations, computed models, and other products.

연구 동기 및 목표

  • 소분자의 대규모 AI 기반 스크리닝을 가능하게 하여 SARS-CoV-2에 대한 약물 발견을 가속화하기 위해.
  • 고성능 계산(HPC)을 활용해 분자 기술자표현과 지문을 사전 계산하여 계산적 장벽을 극복하기 위해.
  • 공개 및 기업 내부 자료에서 유래한 다양한 분자 데이터셋을 통합한 통합적이고 접근 가능한 데이터 자원을 제공하기 위해.
  • 향후 실험적 검증을 위한 후보 약물 물질을 식별하기 위한 기계학습 모델 개발을 지원하기 위해.
  • 미래의 데이터 릴리스를 위한 기반을 마련하기 위해, 분자 구형체, 도킹 시뮬레이션, 과학 문헌에서 추출한 NLP 기반 약물 후보자 등을 포함할 예정이다.

제안 방법

  • 공개 및 내부 자료에서 유래한 23개의 분자 데이터셋을 통합하였으며, 이는 약물 은행, 항바이러스 라이브러리, 기준 가짜 물질 세트를 포함한다.
  • 고성능 계산(HPC)을 사용하여 전체 42억 개 분자에 대해 2D 및 3D 분자 기술자표현, 지문, 2D 분자 이미지를 사전 계산하였다.
  • 분자를 표준 SMILES 문자열로 표현하고, 기계학습 모델 훈련을 지원하기 위해 구조적 및 물리화학적 성질을 보완하였다.
  • Globus 엔드포인트에 데이터를 호스팅하여 웹 인터페이스, REST API 또는 Python SDK를 통해 보안성과 고속 전송을 보장하는 접근과 전송을 가능하게 하였다.
  • 연구자들이 효율적으로 대규모 데이터셋을 브라우징, 다운로드, 전송할 수 있도록 Globus를 활용한 통합된 데이터 액세스 레이어를 제공하였다.
  • 향후 확장성을 고려해 데이터 파이프라인을 설계하였으며, 과학 문헌의 자연어 처리 및 분자 도킹 시뮬레이션을 포함한 확장도 가능하도록 하였다.

실험 결과

연구 질문

  • RQ1대규모, HPC 기반의 분자 기술자표현 및 지문 계산이 AI 기반 약물 스크리닝의 시간과 자원 부담을 크게 줄일 수 있는가?
  • RQ2다양하고 이질적인 분자 데이터셋을 어떻게 통합하여 SARS-CoV-2 연구를 위한 단일 접근 가능하고 계산적으로 풍부한 자원으로 만들 수 있는가?
  • RQ3사전 계산된 분자 특징이 잠재적 항바이러스 제제를 식별하는 기계학습 모델의 정확도와 속도를 어느 정도 향상시킬 수 있는가?
  • RQ4Globus와 같은 고성능 데이터 전송 인fra구조가 대규모 계산 기반 약물 발견에서 협업과 재현 가능성을 어떻게 향상시킬 수 있는가?
  • RQ5AI와 HPC는 SARS-CoV-2에 대한 재활용 또는 새로운 소분자 약물 후보자의 식별을 얼마나 빠르게 가속화할 수 있는가?

주요 결과

  • 첫 번째 데이터 릴리스에는 23개의 데이터셋이 포함되어 있으며, 이는 42억 개 이상의 고유한 분자를 포함하고 있으며, 사전 계산된 분자 지문, 2D 이미지, 2D/3D 기술자표현이 포함되어 있다.
  • 총 60테라바이트의 풍부한 분자 데이터가 고성능 데이터 전송 인프라를 통해 생성되어 공개적으로 이용 가능해졌다.
  • 이 데이터셋은 DrugBank, Enamine, CAS COVID-19 항바이러스 후보자, DUDE 가짜 물질, QM9를 포함한 다양한 출처를 통합하여 모델 훈련에 광범위하게 적용 가능하도록 하였다.
  • 웹 인터페이스, Globus 엔드포인트, Python SDK를 통해 액세스 가능하여 로컬 또는 HPC 시스템으로의 확장 가능한 데이터 접근 및 전송을 지원한다.
  • 이 릴리스를 통해 연구자들은 계산적으로 비용이 많이 드는 기술자표현 계산을 건너뛰고 직접 기계학습 모델을 훈련하거나 배포하여 가상 스크리닝을 수행할 수 있다.
  • 향후 릴리스에서는 분자 구형체, 과학 문헌의 자연어 처리 결과, 분자 도킹 시뮬레이션에서 사전 스크리닝된 후보자들을 포함하여 데이터셋을 확장할 예정이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.