[论文解读] Targeting SARS-CoV-2 with AI- and HPC-enabled Lead Generation: A First Data Release
本文发布了一个大规模、基于人工智能与高性能计算(HPC)的分子数据集,包含超过42亿个分子,其特征包括分子指纹、2D图像以及2D/3D描述符,旨在加速SARS-CoV-2药物发现。该数据集通过高性能计算生成,并通过Globus平台公开提供,支持快速的机器学习筛选,用于已有药物的重新定位或新型抗病毒化合物的发现。
Researchers across the globe are seeking to rapidly repurpose existing drugs or discover new drugs to counter the the novel coronavirus disease (COVID-19) caused by severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2). One promising approach is to train machine learning (ML) and artificial intelligence (AI) tools to screen large numbers of small molecules. As a contribution to that effort, we are aggregating numerous small molecules from a variety of sources, using high-performance computing (HPC) to computer diverse properties of those molecules, using the computed properties to train ML/AI models, and then using the resulting models for screening. In this first data release, we make available 23 datasets collected from community sources representing over 4.2 B molecules enriched with pre-computed: 1) molecular fingerprints to aid similarity searches, 2) 2D images of molecules to enable exploration and application of image-based deep learning methods, and 3) 2D and 3D molecular descriptors to speed development of machine learning models. This data release encompasses structural information on the 4.2 B molecules and 60 TB of pre-computed data. Future releases will expand the data to include more detailed molecular simulations, computed models, and other products.
研究动机与目标
- 通过支持大规模、基于人工智能的小分子筛选,加速SARS-CoV-2药物发现。
- 通过使用高性能计算(HPC)预先计算分子描述符和指纹,克服计算障碍。
- 提供一个统一、可访问的数据资源,整合来自公共和专有来源的多样化分子数据集。
- 支持机器学习模型的开发,以识别有前景的候选药物,供后续实验验证。
- 为未来的数据发布奠定基础,包括分子构象、对接模拟结果以及从自然语言处理中提取的药物候选。
提出的方法
- 从公共和内部来源聚合了23个分子数据集,包括药物库、抗病毒化合物库以及基准假分子集。
- 使用高性能计算(HPC)为全部42亿个分子预先计算2D和3D分子描述符、指纹以及2D分子图像。
- 使用规范SMILES字符串表示分子,并为其补充结构和理化性质,以支持机器学习模型训练。
- 通过Globus端点托管数据,支持通过Web界面、REST API或Python SDK实现安全、高速的数据访问与传输。
- 利用Globus提供统一的数据访问层,使研究人员能够高效地浏览、下载和传输大规模数据集。
- 设计数据处理管道以支持未来扩展,包括科学文献的自然语言处理以及分子对接模拟。
实验结果
研究问题
- RQ1大规模、基于HPC加速的分子描述符与指纹计算,是否能显著减少基于人工智能的药物筛选在时间和资源上的负担?
- RQ2如何将多样且异构的分子数据集统一为一个单一、可访问且计算增强的资源,以支持SARS-CoV-2研究?
- RQ3预先计算的分子特征在多大程度上能够提升机器学习模型在识别潜在抗病毒化合物方面的准确性和速度?
- RQ4高性能数据传输基础设施(如Globus)如何提升大规模计算药物发现中的协作与可重复性?
- RQ5人工智能与高性能计算在加速识别SARS-CoV-2的药物重定位或新型小分子方面,将发挥何种作用?
主要发现
- 首次发布包含23个数据集,涵盖超过42亿个唯一分子,其特征包括预先计算的分子指纹、2D图像以及2D/3D描述符。
- 共生成60TB的增强分子数据,并通过高性能数据传输基础设施向公众开放。
- 该数据集整合了多种来源,包括DrugBank、Enamine、CAS COVID-19抗病毒候选物、DUDE假分子集和QM9,支持广泛的应用于模型训练。
- 数据可通过Web界面、Globus端点以及Python SDK访问,支持将数据高效传输至本地或HPC系统。
- 该发布使研究人员能够跳过计算成本高昂的描述符计算步骤,直接训练或部署机器学习模型用于虚拟筛选。
- 未来发布将扩展数据集,包括分子构象、从科学文献中提取的自然语言处理结果,以及分子对接模拟筛选出的候选物。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。