Skip to main content
QUICK REVIEW

[論文レビュー] Self-focusing virtual screening with active design space pruning

David Graff, Matteo Aldeghi|arXiv (Cornell University)|May 3, 2022
Machine Learning in Materials Science被引用数 6
ひとこと要約

本論文は、自己焦点型バーチャルスクリーニングとアクティブ設計空間のプルーニング(DSP)を導入し、バーチャルスクリーニングにおけるベイズ最適化の計算コストを低減する手法を提案する。この手法では、低可能性化合物を永続的に除外することで、推論の計算負荷を削減する。ヒット確率の閾値(p* = 0.025)を設定することで、ベースライン最適化と同等の性能を維持しながら、推論コストを40%低減し、ベンチマークテストでは上位10,000化合物の67.7%を回収した。

ABSTRACT

High-throughput virtual screening is an indispensable technique utilized in the discovery of small molecules. In cases where the library of molecules is exceedingly large, the cost of an exhaustive virtual screen may be prohibitive. Model-guided optimization has been employed to lower these costs through dramatic increases in sample efficiency compared to random selection. However, these techniques introduce new costs to the workflow through the surrogate model training and inference steps. In this study, we propose an extension to the framework of model-guided optimization that mitigates inferences costs using a technique we refer to as design space pruning (DSP), which irreversibly removes poor-performing candidates from consideration. We study the application of DSP to a variety of optimization tasks and observe significant reductions in overhead costs while exhibiting similar performance to the baseline optimization. DSP represents an attractive extension of model-guided optimization that can limit overhead costs in optimization settings where these costs are non-negligible relative to objective costs, such as docking.

研究の動機と目的

  • 高スループットバーチャルスクリーニングにおける代替モデル推論の計算負荷を低減すること。
  • ドッキングやモデル推論コストが無視できないほど大きな化学ライブラリにおけるスケーラビリティの課題に対処すること。
  • 低可能性化合物を永続的に設計空間から除外しながらも、最適化の性能を維持する手法を開発すること。
  • 全量ドッキングを実施せずに、超大規模ライブラリ(例:21B化合物)を効率的にスクリーニング可能にするための手法を提供すること。
  • 真のアクティブ化合物を除外するリスクと計算効率の向上のバランスを取ること。

提案手法

  • 本手法は、各イテレーションで収集されたデータに基づいてトレーニングされる代替モデル(ガウス過程またはChemprop)を用いたバッチ処理ベイズ最適化を採用する。
  • 設計空間プルーニング(DSP)は、モデル推論と利益関数計算の間に適用され、予測ヒット確率が閾値(p* = 0.025)未満の化合物が除外される。
  • ヒット確率は、予測された目的値と不確実性を用いて計算され、化合物が上位パフォーマンスセットに属する確率を推定する。
  • プルーニングは不可逆的であり、以降のイテレーションでモデル推論が必要な化合物数を削減する。
  • プルーニングの激しさと真のアクティブ化合物の損失リスクのトレードオフを制御するための追加の1つのハイパーパrameter(p*)を用いる。
  • 代替モデルは、ハイパーパrameterチューニングを行わず、各イテレーションで完全に再トレーニングすることで、実世界の展開を模擬する。

実験結果

リサーチクエスチョン

  • RQ1設計空間プルーニングは、バーチャルスクリーニングにおけるベイズ最適化の代替モデル推論の計算コストを顕著に低減できるか?
  • RQ2プルーニングは、大規模な化学ライブラリにおける上位パフォーマンス化合物の回収性能にどの程度悪影響を及ぼすか?
  • RQ3ヒット確率の閾値(p*)の選択が、コスト低減と真のアクティブ化合物の除外リスクのバランスにどのように影響するか?
  • RQ4DSPは、超大規模ライブラリスクリーニングにおいて、推論オーバーヘッドを低減しながら、ベースライン最適化と同等の性能を維持できるか?
  • RQ5本手法は、DOCKSTRING や AmpC-Glide といった実世界のドッキングデータセットに対しても、効果的にスケーリング可能か?

主な発見

  • 提案されたDSP手法は、ベースラインベイズ最適化と比較して、推論およびトレーニングのオーバーヘッドコストを40%削減した。
  • 本手法は、テストオラクルベンチマークで上位10,000化合物の67.7%を効果的に回収し、ベースライン最適化と同等の性能を達成した。
  • p* = 0.025でプルーニングを実施したことで、低可能性化合物が効果的に除外されたが、上位パフォーマンス分子の回収精度に悪影響を及げなかった。
  • 本手法は、多様なテストオラクルおよび実ドッキングデータセット(DOCKSTRING および AmpC-Glide)において一貫した性能を示した。
  • 本手法は、21B化合物を有するEnamine REALデータベースのような超大規模ライブラリに対してもスケーラブルであることが示された。この場合、全量スクリーニングには7,000年以上のCPU年数を要する。
  • 追加の1つのハイパーパrameter(p*)により、ユーザーがプルーニングの激しさと偽陰性のリスクのトレードオフを調整可能となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。