[論文レビュー] Exploring Chemical Space with Score-based Out-of-distribution Generation
本稿では、分子空間における学習分布を超えた制御された探索を可能にするスコアベースの拡散モデル、Molecular Out-of-distribution Diffusion (MOOD) を提案する。学習可能なハイパーパrameter λ を統合し、分布外(OOD)生成を制御するとともに、特性予測子からの勾配を活用することで、新規で高い親和性を示す分子を生成する。MOOD は、追加計算コストを伴わず、結合親和性と新規性の両面で最先端の手法を上回る性能を発揮する。
A well-known limitation of existing molecular generative models is that the generated molecules highly resemble those in the training set. To generate truly novel molecules that may have even better properties for de novo drug discovery, more powerful exploration in the chemical space is necessary. To this end, we propose Molecular Out-Of-distribution Diffusion(MOOD), a score-based diffusion scheme that incorporates out-of-distribution (OOD) control in the generative stochastic differential equation (SDE) with simple control of a hyperparameter, thus requires no additional costs. Since some novel molecules may not meet the basic requirements of real-world drugs, MOOD performs conditional generation by utilizing the gradients from a property predictor that guides the reverse-time diffusion process to high-scoring regions according to target properties such as protein-ligand interactions, drug-likeness, and synthesizability. This allows MOOD to search for novel and meaningful molecules rather than generating unseen yet trivial ones. We experimentally validate that MOOD is able to explore the chemical space beyond the training distribution, generating molecules that outscore ones found with existing methods, and even the top 0.01% of the original training pool. Our code is available at https://github.com/SeulLee05/MOOD.
研究の動機と目的
- 既存の分子生成モデルが主に学習データセットに類似した分子しか生成できないという限界を是正すること。
- QED やペナルティ付き logP といった単純な分子特性に依存する手法が、つまらないまたはドラッグライクでない分子を生成する傾向にあるという制限を克服すること。
- 高い結合親和性、ドラッグライクネス、合成可能性といった、現実のドラッグディスcovery要件を満たす複数の目的を同時に満たす新規分子の有効な生成を可能にすること。
- 追加の計算コストを負担せずに、学習分布を超えた化学空間の探索を実現する手法の開発
提案手法
- 学習データ分布からの逸脱度を制御するハイパーパrameter λ を用いた、スコアベース生成モデルにおける新規なOOD制御付き逆時系列拡散プロセスを提案する。
- 軽量な特性予測子を用いた勾配ベースの条件付き生成スキームを導入し、逆拡散プロセスを化学空間内の高得点領域へ誘導する。
- OOD制御を、スコア関数を λ でスケーリングする修正されたドリフト項を備えた、確率的微分方程式(SDE)フレームワークに組み込む。
- 初期状態をランダムノイズとし、反復的にノイズ除去することで有効な分子構造へと向かうノイズ除去拡散プロセスを採用する。OOD制御により、低密度の分布外領域への探索が可能となる。
- OOD制御と特性勾配誘導を組み合わせ、新規性の促進と望ましい分子特性(例えばタンパク質リガンド結合親和性)の最適化を同時に実現する。
- 強化学習ベースや反復的オラクルベースの手法とは異なり、追加の推論やトレーニングのオーバーヘッドなしに、λ のチューニングのみでゼロコストのOOD生成を達成する。
実験結果
リサーチクエスチョン
- RQ1スコアベースの拡散モデルは、学習分布を超えて、新規かつ化学的に意味のある分子を効果的に生成できるか?
- RQ2OOD制御機構におけるハイパーパrameter λ の値が、分子の新規性と特性最適化のバランスにどのように影響するか?
- RQ3OOD制御付き拡散と特性勾配誘導を組み合わせることで、学習セットの上位 0.01% に比して高い結合親和性を持つ分子を生成できるか?
- RQ4本手法は、計算コストを抑えながら、既存の最先端モデルを上回って新規で高親和性の分子を生成できるか?
- RQ5本手法は、学習済み分子とは構造的に著しく異なるが、高いドラッグライクネスと合成可能性を有する分子を生成できるか?
主な発見
- PARP1 ターゲットにおいて、MOOD は 7.017% の新規ヒット率を達成し、LIMO(0.455%)や他のベースラインを大きく上回った。
- MOOD が生成した分子の結合親和性は -10.865 kcal/mol(上位 5% DS)に達し、ZINC250k 学習セットの上位 0.01% を上回った。
- λ = 0.04 の場合、MOOD は新規性(84.18%)と高得点特性の両立において最良のバランスを達成し、λ = 0.03 や λ = 0.05 を上回った。
- MOOD が生成した分子は、どの訓練分子に対しても顕著なサブ構造的類似性を示さず、真のOOD生成を確認した。
- 3,000 個の分子生成に 682.4 秒を要したが、これはランダムベースラインと同等であり、FREED などの高コストなオラクルベース手法(17,063.7 秒)を大きく上回った。
- Dockstring F2 ベンチマークでは、MOOD は -3.920 のスコアを達成し、LIMO(-0.318)や FREED(-3.391)を顕著に上回り、優れた多目的最適化を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。