[論文レビュー] The Synthesizability of Molecules Proposed by Generative Models
本論文は、最先端の深層生成モデルが生成する分子の合成可能性を、データ駆動型の逆合成プランニングツール(ASKCOS)を用いて評価し、高得点の分子の多くが実際に合成不能であることが判明した。ヒューリスティックなバイアス(特にSCScoreやSA_Scoreの使用)により合成可能性が向上するが、目的関数の性能が低下するという代償が伴うことが示され、新規性・物性最適化・合成可能性のバランスを取る新しいアルゴリズムの開発の必要性が浮き彫りになった。
The discovery of functional molecules is an expensive and time-consuming process, exemplified by the rising costs of small molecule therapeutic discovery. One class of techniques of growing interest for early-stage drug discovery is de novo molecular generation and optimization, catalyzed by the development of new deep learning approaches. These techniques can suggest novel molecular structures intended to maximize a multi-objective function, e.g., suitability as a therapeutic against a particular target, without relying on brute-force exploration of a chemical space. However, the utility of these approaches is stymied by ignorance of synthesizability. To highlight the severity of this issue, we use a data-driven computer-aided synthesis planning program to quantify how often molecules proposed by state-of-the-art generative models cannot be readily synthesized. Our analysis demonstrates that there are several tasks for which these models generate unrealistic molecular structures despite performing well on popular quantitative benchmarks. Synthetic complexity heuristics can successfully bias generation toward synthetically-tractable chemical space, although doing so necessarily detracts from the primary objective. This analysis suggests that to improve the utility of these models in real discovery workflows, new algorithm development is warranted.
研究の動機と目的
- 最先端の深層生成モデルが分子設計において生成する分子の合成可能性を評価すること。
- 生成モデルが得た高得点分子が、自動化された逆合成プランニングによって実際に合成不能である頻度を定量化すること。
- 後からフィルタリング、トレーニングデータ選択、ヒューリスティックな目的関数の修正といった、異なるバイアス戦略の合成可能性向上効果を評価すること。
- 生成モデルにおける望ましい分子物性の最適化と合成可能性の確保の間のトレードオフを特定すること。
- 分子生成パイプラインに合成可能性をよりよく統合する新しいアルゴリズム開発を提唱すること。
提案手法
- 著者らは、ASKCOSというデータ駆動型のコンピュータ支援合成計画ツールを用いて、生成モデルが生成する分子の合成可能性を評価した。
- グラフベースの遺伝的アルゴリズムを用いて、単純なタスクと困難なマルチオブジェクティブ最適化(MPO)タスクの両方で生成された分子にこの手法を適用した。
- 後からフィルタリングは、分子がASKCOSの合成可能性フィルタに合格するか否かをテストすることで実施した。
- トレーニングデータのバイアスは、ChEMBL(68.3%の合成可能率)とMOSES(89.8%の合成可能率)をトレーニングデータソースとして使用して検証した。
- ヒューリスティックバイアスは、SCScore、SA_Score、またはSMILES長に基づく乗数を目的関数に組み込み、ガウス関数およびシグモイド関数を用いて、複雑またはレアなフラグメントをペナルティ化することで実装した。
- バイアス関数のハイパーパrameterは、上位10個の分子の合成可能率と平均目的関数スコアの積を最大化するように、30回のTree Parzen Estimator(TPE)ベイズ最適化を実行して調整した。
実験結果
リサーチクエスチョン
- RQ1最先端の生成モデルが提案する分子は、標準ベンチマークで高得点を取っているにもかかわらず、どれほど頻繁に合成不能であるのか?
- RQ2後からフィルタリング、トレーニングデータ選択、またはヒューリスティックバイアスによって、生成された分子の合成可能性はどの程度向上するのか?
- RQ3分子生成において、目的関数(例:ドラッグライクネス)を最大化することと、合成可能性を確保することの間には、どのようなトレードオフがあるのか?
- RQ4SA_Score、SCScore、またはSMILES長のうち、どのヒューリスティックスコアが、主な最適化目的関数の性能を著しく低下させることなく、合成可能性の向上に最も効果的か?
- RQ5生成目的関数に合成可能性を統合することで、実世界のドラッグディスcoveryワークフローにおいてより実用的な分子設計が可能になるのか?
主な発見
- ASKCOSを用いた逆合成プランニングによる評価で、最先端の生成モデルが生成する分子の顕著な割合が、標準ベンチマークで高得点を取っているにもかかわらず、合成不能であることが判明した。
- ASKCOSを用いた後からフィルタリングは、合成可能分子の数を減らすが、そもそも合成不能な構造を生成してしまう根本的要因には対処しない。
- トレーニングデータのバイアスにより合成可能性が向上し、MOSES(89.8%の合成可能率)がChEMBL(68.3%の合成可能率)を上回る性能を示した。
- SCScoreまたはSA_Scoreを用いたヒューリスティックバイアスは、合成可能分子の割合を顕著に向上させるが、上位10分子の平均目的関数スコアが低下するという代償が伴う。
- TPEベイズ最適化により、SCScoreおよびSA_Scoreの乗数の最適ハイパーパrameterが同定され、目的関数性能と合成可能性のバランスの取れた最適化が可能であることが示された。
- SMILES長は、合成可能性バイアスに有効でないことが判明し、この指標に適切なハイパーパrameterを取得できなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。