Skip to main content
QUICK REVIEW

[論文レビュー] Lo-Hi: Practical ML Drug Discovery Benchmark

Simon Steshin|arXiv (Cornell University)|Oct 10, 2023
Computational Drug Discovery Methods被引用数 5
ひとこと要約

この論文は、実用的な機械学習ベンチマークであるLo-Hiを紹介し、2つの異なる現実世界のタスクを分離する:Hit Identification (Hi) は、構造的に異なる新しい分子の特性を予測することに注力し、Lead Optimization (Lo) は、既知の活性化合物の微小な構造的変更を対象としている。著者らは、バランスの取れた頂点最小 $k$-カット問題に基づく新しい分子分割アルゴリズムを提案し、現実的で重複のないデータセットを生成した。その結果、モデルの性能がこれらのタスクで顕著に異なることが明らかになり、HiではChempropが他のモデルを上回り、LoではECFP4特徴量を用いたSVMが優れた性能を示した。

ABSTRACT

Finding new drugs is getting harder and harder. One of the hopes of drug discovery is to use machine learning models to predict molecular properties. That is why models for molecular property prediction are being developed and tested on benchmarks such as MoleculeNet. However, existing benchmarks are unrealistic and are too different from applying the models in practice. We have created a new practical \emph{Lo-Hi} benchmark consisting of two tasks: Lead Optimization (Lo) and Hit Identification (Hi), corresponding to the real drug discovery process. For the Hi task, we designed a novel molecular splitting algorithm that solves the Balanced Vertex Minimum $k$-Cut problem. We tested state-of-the-art and classic ML models, revealing which works better under practical settings. We analyzed modern benchmarks and showed that they are unrealistic and overoptimistic. Review: https://openreview.net/forum?id=H2Yb28qGLV Lo-Hi benchmark: https://github.com/SteshinSS/lohi_neurips2023 Lo-Hi splitter library: https://github.com/SteshinSS/lohi_splitter

研究の動機と目的

  • 既存のベンチマークにおけるギャップを埋めるために、実際のドラッグディスcoveryワークフローにおける分子特性予測のための現実的で評価可能なフレームワークを構築すること。
  • MoleculeNetのような現在のベンチマークがなぜ楽観的すぎるのか、そしてなぜ実際のドラッグディスcoveryの課題を反映していないのかを特定すること。
  • 分子の新規性と非重複性を保証する新しいデータセット分割法を開発し、実際のスクリーニング状況を模擬すること。
  • 最先端の機械学習モデルと古典的モデルを、現実的なHiおよびLoシナリオで評価し、それぞれのタスクに最も適したアーキテクチャを特定すること。
  • モデルの性能がタスクの文脈によって顕著に異なることが示され、高いベンチマークスコアが必ずしも実世界での有用性を意味するわけではないという仮定に疑問を呈すること。

提案手法

  • 実際のドラッグディスcovery段階を反映する2つの明確に分離されたタスク(Hit Identification (Hi) と Lead Optimization (Lo))を有する新しいベンチマークフレームワークを提案した。
  • 非重複性、多様性、現実性を保証するため、整数線形計画法に基づく新しい分子スプリッタを設計し、バランスの取れた頂点最小 $k$-カット問題を解くことで、訓練用およびテスト用データセットを生成した。
  • 実際の分子データを用いて、新規の実用的データセットを7つ作成し、新規性と構造的多様性を保つように慎重にフィルタリングを行った。
  • AUC-PRやスピアマン相関係数といった標準化された指標を用いて、XGBoost、SVM、MLP、Chemprop、Graphormerなどの多様なモデルを、両方のタスクで評価した。
  • ハイパーパramータチューニングにはランダムサーチとエアリー・ストーピングを適用し、データ漏洩を避けるためにバリデーション性能に基づくモデル選択を実施した。
  • Loタスクではクラスタベースの評価を実施し、分子クラスタ内でのスピアマン相関を計算し、クラスタ間で平均化することで、実際の最適化文脈を反映した。
Figure 1: Hit Identification (Hi) task
Figure 1: Hit Identification (Hi) task

実験結果

リサーチクエスチョン

  • RQ1最先端および古典的機械学習モデルは、現実のドラッグディスcovery条件下で、特に新しい分子と既知の活性化合物を区別できるか、どのように性能を示すか?
  • RQ2MoleculeNetのような既存のベンチマークは、現実的でないデータ分割法やタスク定式化のため、モデル性能をどれほど楽観的に評価しているのか?
  • RQ3Hit IdentificationとLead Optimizationのそれぞれに、一般化能力と微小な構造的変更への感受性という異なる要件を考慮すると、どの機械学習アーキテクチャが最も適しているか?
  • RQ4バランスの取れた頂点最小 $k$-カット問題に基づく新しい分子スプリッタは、標準的なランダムスプリットやスケルトンスプリットに比べ、より現実的で実用的なベンチマークデータセットを生成できるか?
  • RQ5Loタスクではクラスタベースのスピアマン相関、Hiタスクでは標準的なAUC-PRで評価した場合、モデルの性能にどのような差が現れ、実際のモデル選定にどのような示唆があるか?

主な発見

  • Lo-Hiベンチマークは、MoleculeNet風のベンチマークに最適化されたモデルが、Hit Identificationにおける真に新しい分子への一般化に失敗することが明らかになった。これは、現在のベンチマークが楽観的すぎる傾向にあることを示している。
  • ChempropはHiタスクで一貫して他のモデルを上回り、複数のデータセットで最高のAUC-PRを達成した。特にHIV-Hiでは0.92、DRD2-Hiでは0.88を記録した。
  • Loタスクでは、ECFP4特徴量を用いたSVMが平均で最高のスピアマン相関(KDR-Loでは0.78)を示し、Graphormer や Chemprop といったディープラーニングモデルを大きく上回った。
  • バランスの取れた頂点最小 $k$-カット問題に基づく新しい分子スプリッタは、非重複性と多様性を保証するデータセットを効果的に生成し、現実のスクリーニング状況をよりよく再現した。
  • Graphormerは性能が低く、依存関係の問題や遅い学習といった顕著な技術的課題を抱えており、その洗練されたアーキテクチャにもかかわらず、実用性に制限があった。
  • 本研究は、モデル選定はタスクに特化する必要があることを示している。Hiには、新しい構造への強力な一般化能力が求められ、Loには微小な化学的変更への高い感受性が求められる。
Figure 2: Lead Optimization (Lo) task
Figure 2: Lead Optimization (Lo) task

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。