[論文レビュー] Pandemic Drugs at Pandemic Speed: Infrastructure for Accelerating COVID-19 Drug Discovery with Hybrid Machine Learning- and Physics-based Simulations on High Performance Computers
本論文は、高性能計算(HPC)によって加速されたハイブリッド機械学習(ML)および物理ベース(PB)シミュレーションワークフローを提示し、SARS-CoV-2の抗ウイルス薬候補の同定を前例のない速さで実現した。熱力学的統合と強化サンプリング(TIES)を統合して正確な結合親和定数予測を実現し、MLモデルを用いて効率的な化学空間探索を実現することで、数百万化合物の高スループットスクリーニングが可能となり、4つのウイルス標的に対して定量的な自由エネルギー予測を伴うリード化合物を効果的に同定した。
The race to meet the challenges of the global pandemic has served as a reminder that the existing drug discovery process is expensive, inefficient and slow. There is a major bottleneck screening the vast number of potential small molecules to shortlist lead compounds for antiviral drug development. New opportunities to accelerate drug discovery lie at the interface between machine learning methods, in this case developed for linear accelerators, and physics-based methods. The two in silico methods, each have their own advantages and limitations which, interestingly, complement each other. Here, we present an innovative infrastructural development that combines both approaches to accelerate drug discovery. The scale of the potential resulting workflow is such that it is dependent on supercomputing to achieve extremely high throughput. We have demonstrated the viability of this workflow for the study of inhibitors for four COVID-19 target proteins and our ability to perform the required large-scale calculations to identify lead antiviral compounds through repurposing on a variety of supercomputers.
研究の動機と目的
- 従来の薬物発見プロセスが約10年と10億~30億ドルを要するというボトル neck を解消し、SARS-CoV-2の抗ウイルス化合物の同定を迅速化すること。
- 単独の機械学習や物理ベース手法の限界を克服するため、MLの高速性とPBの正確性を補完的に統合すること。
- 多数のスーパーコンピュータをカバーする大規模なシミュレーションを処理可能なスケーラブルかつ高スループットの計算インfraストラクチャを開発すること。
- 既存薬の迅速な再利用を可能にするために、リガンドとSARS-CoV-2の主要標的タンパク質との結合親和定数を高い精度で予測すること。
- MLとPBシミュレーションの間で反復的フィードバックループを構築し、最適なリード化合物に向けた化学的修飾を支援すること。
提案手法
- タンパク質-リガンド結合親和定数の正確で再現可能かつスケーラブルな自由エネルギー計算のため、強化サンプリングを組み合わせた熱力学的統合(TIES)を採用する。
- カオス的初期条件に起因するばらつきを低減し、結合親和定数予測の統計的信頼性を向上させるためにアンサンブルシミュレーションを用いる。
- TIESで得られた結合親和定数を訓練データとして統合し、リガンド効果の予測を繰り返し改善するMLモデルを発展させる。
- 段階的フィルタリングワークフローを実装:初期段階でMLスクリーニングを実施し、その後上位候補に対して高精度なTIES検証を実施する。
- SuperMUC-NG、OLCF、TACCを含む複数のスーパーコンピュータを活用し、HPCインfraストラクチャを活用してシミュレーションをスケーリングする。
- 分散HPCリソースに跨る異種かつ計算集約的なタスクを調整するため、専用のワークフローマネージャ(例:RCT)を実装する。
実験結果
リサーチクエスチョン
- RQ1ハイブリッドML-PBシミュレーションワークフローは、SARS-CoV-2の薬物再利用に向けたリード化合物の同定を著しく高速化できるか?
- RQ2TIESに基づく自由エネルギー計算は、SARS-CoV-2タンパク質を標的にする多様なリガンドの結合親和定数をどの程度正確に予測できるか?
- RQ3PBシミュレーションデータをMLモデルに統合することで、化学空間探索における予測精度と収束速度はどの程度向上するか?
- RQ4このハイブリッドワークフローは、複数の異種HPCシステムに効率的にスケーリング可能であり、パンデミック速度での薬物発見を実現できるか?
- RQ5リガンドにおけるどの構造的変化が結合親和定数の好転または悪化を引き起こし、その変化は信頼性を持って予測可能か?
主な発見
- ハイブリッドML-PBワークフローは、複数のスーパーコンピュータ上で大規模なシミュレーションを実行することで、4つのSARS-CoV-2標的タンパク質に対してリード抗ウイルス化合物を効果的に同定した。
- TIESシミュレーションは、結合親和定数予測において高い正確性と精度を達成し、特定の変換に対しては不確実性が±0.44 kcal/molまで低減した。
- ADR P標的に対しては、19個のリガンド変換のうち12個がΔΔ𝐺 > +1 kcal/molを示し、結合親和定数の悪化を示したが、残りの7つはΔΔ𝐺 ≈ 0であり、顕著な影響なしを示した。
- 変換a42-a43は最大の悪化を示し、ΔΔ𝐺 = 4.62 ± 0.82 kcal/molを記録し、結合親和定数の著しい不安定化を示した。
- PBから得られたエネルギー的データを用いて、MLモデルの反復的改善が可能となり、有望な化学空間領域への収束が加速された。
- このパイプラインは、SuperMUC-NG、OLCF、TACCを含む多様なHPCシステムに成功裏に展開され、移植性とスケーラビリティが実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。