[論文レビュー] Screening of Therapeutic Agents for COVID-19 using Machine Learning and Ensemble Docking Simulations
本研究では、SARS-CoV-2スパイクタンパク質およびヒトACE2と複合するスパイクタンパク質に対するリガンドの結合親和定数を予測することで、COVID-19の治療薬候補を迅速にスクリーニングするためのハイブリッド機械学習およびアンサンブルドッキング手法を提示する。この手法により、100万分子のデータセットから19,000件の高可能性のある候補が同定され、高精度なランダムフォレストモデルを用いた妥当性確認により、計算コストを抑えつつスクリーニング速度を著しく向上させた。
The world has witnessed unprecedented human and economic loss from the COVID-19 disease, caused by the novel coronavirus SARS-CoV-2. Extensive research is being conducted across the globe to identify therapeutic agents against the SARS-CoV-2. Here, we use a powerful and efficient computational strategy by combining machine learning (ML) based models and high-fidelity ensemble docking simulations to enable rapid screening of possible therapeutic molecules (or ligands). Our screening is based on the binding affinity to either the isolated SARS-CoV-2 S-protein at its host receptor region or to the Sprotein-human ACE2 interface complex, thereby potentially limiting and/or disrupting the host-virus interactions. We first apply our screening strategy to two drug datasets (CureFFI and DrugCentral) to identify hundreds of ligands that bind strongly to the aforementioned two systems. Candidate ligands were then validated by all atom docking simulations. The validated ML models were subsequently used to screen a large bio-molecule dataset (with nearly a million entries) to provide a rank-ordered list of ~19,000 potentially useful compounds for further validation. Overall, this work not only expands our knowledge of small-molecule treatment against COVID-19, but also provides an efficient pathway to perform high-throughput computational drug screening by combining quick ML surrogate models with expensive high-fidelity simulations, for accelerating the therapeutic cure of diseases.
研究の動機と目的
- 高精度なドッキングシミュレーションの計算的ボトル neck を克服することで、SARS-CoV-2の治療薬候補のバーチャルスクリーニングを加速すること。
- SプロテインおよびSプロテイン:ACE2インターフェースを標的にするリガンドの結合親和定数(Vinaスコア)を予測する、正確な機械学習サーヴィレートモデルを開発すること。
- 既知の薬物を越えて、約100万のバイオ分子からなる広大な化学的空間を、妥当性確認済みのMLモデルを用いてスクリーニングすること。
- さらなる実験的検証のための、強い結合親和定数とドラッグライク性を示すトップ候補化合物を同定すること。
- 出現する疾患に応用可能な、スケーラブルで効率的な高スルーレット計算ドラッグディスcoveryフレームワークを提供すること。
提案手法
- 孤立したSプロテインおよびSプロテイン:ACE2複合体へのリガンド結合のAutoDock Vinaスコアを予測するための、2つの独立したランダムフォレスト回帰モデルを訓練した。
- リガンドの入力に使用するため、複数の長さスケールにわたる幾何学的および化学的特徴を捉える階層的分子記述子を用いた。
- CureFFIおよびDrugCentralの約5,500のリガンドからなるデータセットを、以前の高精度なアンサンブルドッキングシミュレーションから得たもので、モデルを訓練した。
- 精度を保証するため、上位候補数百件について、全原子ドッキングシミュレーションと照合してML予測を妥当性確認した。
- 妥当性確認済みのMLモデルを用いて、約100万のバイオ分子からなるBindingDBデータセットをスクリーニングし、高親和性結合体を同定した。
- ドッキングスコアがしきい値未満であるという基準に基づくスクリーニング基準を適用し、BindingDBから約19,000件の有望な候補をランク付け・選別した。
実験結果
リサーチクエスチョン
- RQ1高精度なドッキングデータで訓練された機械学習モデルは、SARS-CoV-2治療薬候補の結合親和定数を正確に予測できるか?
- RQ2MLサーヴィレートモデルは、精度を維持しつつ、バーチャルスクリーニングの計算コストをどの程度低減できるか?
- RQ3MLドッキングハイブリッド手法は、既知の薬物を超えた広大な化学的空間の探索において、どの程度スケーラブルか?
- RQ4BindingDBデータセットから得られた上位ランクの化合物のうち、強い結合親和定数と望ましいドラッグライク性を示すものは何か?
- RQ5この手法は、COVID-19の再利用可能性を有するFDA承認薬または天然化合物を同定できるか?
主な発見
- MLモデルは高い予測精度を達成し、CureFFIおよびDrugCentralのスクリーニング対象となった187件のFDA承認薬リガンドのうち175件が、孤立SプロテインおよびSプロテイン:ACE2複合体の両方に対して強く結合すると予測された。ドッキングシミュレーションによる確認が得られた。
- ML予測を用いることで、BindingDBの約100万のバイオ分子を1日未塔でスクリーニング可能であり、187件の候補についてドッキングシミュレーションを実行するのに約2日間を要するのに対し、大幅に短縮された。
- BindingDBデータセットから、両方の標的系に対して結合親和定数のしきい値を満たす、合計19,000件の高親和性リガンドが同定された。
- トップ候補には、フィダレスタット、キウルセチン、マイリセチン、S-クロモヤンエチン、インディルービン、カップレスフラボンなどがあり、いずれも強い予測結合親和定数と関連する生物学的活性を示した。
- 上位ランクの化合物の多く、特に複数のFDA承認薬がリピングスキーの「5つのルール」を満たしており、望ましいドラッグライク性を示した。
- MLドッキングハイブリッドワークフローは、SARS-CoV-2およびその他の疾患に対する治療薬候補の高スルーレットバーチャルスクリーニングのための、スケーラブルで効率的かつ正確なパイプラインを提供する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。