[論文レビュー] Targeting SARS-CoV-2 with AI- and HPC-enabled Lead Generation: A First Data Release
本論文では、SARS-CoV-2の薬剤発見を加速するために、AIおよびHPCを活用した大規模なデータリリースを提供する。42億を超える分子が、分子フィンガープrint、2次元画像、2次元/3次元記述子で豊富に充実しており、これらは高性能コンピューティングを用いて生成され、Globus経由で公開されている。このデータセットにより、再利用または新規の抗ウイルス化合物のための迅速な機械学習スクリーニングが可能となる。
Researchers across the globe are seeking to rapidly repurpose existing drugs or discover new drugs to counter the the novel coronavirus disease (COVID-19) caused by severe acute respiratory syndrome coronavirus 2 (SARS-CoV-2). One promising approach is to train machine learning (ML) and artificial intelligence (AI) tools to screen large numbers of small molecules. As a contribution to that effort, we are aggregating numerous small molecules from a variety of sources, using high-performance computing (HPC) to computer diverse properties of those molecules, using the computed properties to train ML/AI models, and then using the resulting models for screening. In this first data release, we make available 23 datasets collected from community sources representing over 4.2 B molecules enriched with pre-computed: 1) molecular fingerprints to aid similarity searches, 2) 2D images of molecules to enable exploration and application of image-based deep learning methods, and 3) 2D and 3D molecular descriptors to speed development of machine learning models. This data release encompasses structural information on the 4.2 B molecules and 60 TB of pre-computed data. Future releases will expand the data to include more detailed molecular simulations, computed models, and other products.
研究の動機と目的
- AI駆動のスクリーニングによるSARS-CoV-2の薬剤発見を加速すること。
- 高性能コンピューティング(HPC)を用いて事前に分子記述子とフィンガープリントを計算することで、計算上の障壁を克服すること。
- 公的および企業所有の多様な分子データセットを統合した、統一的かつアクセス可能なデータリソースを提供すること。
- 今後の実験的検証の対象となる有望な候補薬を同定するための機械学習モデルの開発を支援すること。
- 今後のデータリリースの基盤を築くこと。具体的には、分子コンフォーマー、ドッキングシミュレーション、NLPを用いた科学文献からの候補抽出を含む。
提案手法
- DrugBank、アンチバイラルライブラリー、ベンチマークのノイズセットを含む、公的および社内ソースからの23の分子データセットを統合した。
- 高性能コンピューティング(HPC)を用いて、42億個のすべての分子について、2次元および3次元の分子記述子、フィンガープリント、2次元分子画像を事前に計算した。
- 分子を標準的なSMILES文字列で表現し、機械学習モデルの学習を支援するため、構造的および物理化学的性質を追加で豊かにした。
- Globusエンドポイントにデータをホスティングし、Webインターフェース、REST API、Python SDKを介して、安全かつ高速なアクセスと転送を可能にした。
- Globusを用いた統一されたデータアクセスレイヤーを提供し、研究者が大規模データセットを効率的にブラウズ、ダウンロード、転送できるようにした。
- 将来的な拡張を想定して、データパイプラインを設計した。具体的には、科学文献の自然言語処理や分子ドッキングシミュレーションの対応を含む。
実験結果
リサーチクエスチョン
- RQ1大規模かつHPCで加速された分子記述子およびフィンガープリントの計算は、AIベースの薬剤スクリーニングにおける時間的・リソース的負担を顕著に軽減できるか?
- RQ2多様で不均一な分子データセットを、1つのアクセス可能で計算的に豊富なリソースに統合する方法は何か?
- RQ3事前に計算された分子特徴は、潜在的な抗ウイルス化合物を同定する機械学習モデルの精度と速度をどの程度向上できるか?
- RQ4Globusのような高パフォーマンスなデータ転送インfraは、大規模な計算的薬剤発見における協働作業と再現可能性をどのように向上できるか?
- RQ5AIおよびHPCは、SARS-CoV-2に対する再利用または新規の低分子を迅速に同定する上で、どのような役割を果たせるか?
主な発見
- 初回リリースでは、42億個を超えるユニークな分子を含む23のデータセットが提供され、事前に計算された分子フィンガープリント、2次元画像、2次元/3次元記述子が含まれている。
- 合計60テラバイトにのぼる強化済みの分子データが生成され、高パフォーマンスなデータ転送インfraを介して公開された。
- DrugBank、Enamine、CAS COVID-19アンチバイラル候補、DUDEノイズセット、QM9を含む多様なソースが統合されており、モデルのトレーニングに広く応用可能である。
- Webインターフェース、Globusエンドポイント、Python SDKを介してデータにアクセス可能であり、ローカルまたはHPCシステムへのスケーラブルなデータアクセスと転送を支援する。
- このリリースにより、研究者は計算的に高コストな記述子計算を回避し、直接仮想スクリーニング用のMLモデルのトレーニングやデプロイを実行できるようになった。
- 今後のリリースでは、分子コンフォーマー、科学文献の自然言語処理結果、分子ドッキングシミュレーションからの事前スクリーニング候補を含むデータセットの拡張が予定されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。