[論文レビュー] It Takes Two to Tango: Directly Optimizing for Constrained Synthesizability in Generative Molecular Design
本論文は、化学的原則を用いて、生成的分子モデルの制約付き合成可能性を直接最適化する新しい密な報酬関数TANGOを導入する。強化学習を用いて、特定の商業的構成ブロックを強制的に組み込む一方で、複数のパラメータを最適化する目標を満たす分子を生成可能にする。これは、出発原料、中間体、発散的合成の制約を含む、あらゆるタイプの制約に対して、最先端の性能を示す最初のフレームワークである。
Constrained synthesizability is an unaddressed challenge in generative molecular design. In particular, designing molecules satisfying multi-parameter optimization objectives, while simultaneously being synthesizable and enforcing the presence of specific commercial building blocks in the synthesis. This is practically important for molecule re-purposing, sustainability, and efficiency. In this work, we propose a novel reward function called TANimoto Group Overlap (TANGO), which uses chemistry principles to transform a sparse reward function into a dense and learnable reward function -- crucial for reinforcement learning. TANGO can augment general-purpose molecular generative models to directly optimize for constrained synthesizability while simultaneously optimizing for other properties relevant to drug discovery using reinforcement learning. Our framework is general and addresses starting-material, intermediate, and divergent synthesis constraints. Contrary to most existing works in the field, we show that incentivizing a general-purpose (without any inductive biases) model is a productive approach to navigating challenging optimization scenarios. We demonstrate this by showing that the trained models explicitly learn a desirable distribution. Our framework is the first generative approach to tackle constrained synthesizability.
研究の動機と目的
- 出発原料、中間体、発散的合成の制約を含む、制約付き合成可能性を直接最適化するという未解決の課題に対処すること。
- 疎な報酬を行動可能な信号に変換する、学習可能な密な報酬関数を構築すること。
- 誘導的バイアスを含まない汎用的生成モデルが、薬剤発見に関連する特性を最適化しながら、合成可能である分子の分布を学習できるようにすること。
- 特定のアーキテクチャの制約を課えるのではなく、汎用モデルにインcentivize(インcentivize)することにより、複雑な多目的分子設計問題を効果的に解決するアプローチが有効であることを示すこと。
- フレームワークが、高いドッキングスコアと高いQED値を持つ分子を生成し、合成経路において強制された構成ブロックが使用されることを保証できることを示すこと。
提案手法
- 生成された分子と強制された構成ブロック内の機能的基団の重なりを定量化する、化学的インスピレーションを受けて設計された密な報酬関数「TANimotoグループオーバーラップ(TANGO)」を提案する。
- 合成可能性を評価し報酬関数をガイドするために、レトロ合成モデルをオラクルとして用いる。これにより、生成された分子が合成的に現実的であることを保証する。
- 複数の分子的特性(例:ドッキングスコア、QED)と合成可能性を同時に最適化する強化学習フレームワークにTANGOを統合する。
- 出発原料、中間体、発散的合成の多様な合成制約を適用し、強制された構成ブロックを組み込む。
- 誘導的バイアスを含まない汎用的生成モデルを用い、アーキテクチャ的制約ではなく報酬設計によって合成可能性を学習させる。
- 10個のランダムシードを用いた複数の構成で、オラクル予算とQED強制の変動を含め、アプローチを検証する。

実験結果
リサーチクエスチョン
- RQ1誘導的バイアスを含まない汎用的生成モデルが、アーキテクチャ的制約なしに、合成可能である分子の分布を効果的に学習できるか?
- RQ2TANGOのような密で化学的根拠を持つ報酬関数が、多パラメータ最適化を満たし、特定の構成ブロックを強制する方向に強化学習を効果的に導けるか?
- RQ31つの学習レジームで、薬剤発見に関連する特性(例:ドッキングスコア、QED)と制約付き合成可能性を同時に最適化することが可能か?
- RQ4フレームワークの性能は、出発原料、中間体、発散的合成といった異なる種類の合成制約においてどのように変化するか?
- RQ5オラクル予算を増加させることで、強制された構成ブロックを含む分子の生成成功率が向上するか?また、実用的にスケーラブルか?
主な発見
- TANGOフレームワークは、10,000のオラクル予算で、発散的合成を含むすべてのテスト構成で、強制された構成ブロックを含む分子を生成した。10個のシードのうち4つが少なくとも1つの有効な分子を達成した。
- 15,000のオラクル予算では、発散的ブロックの成功確率が10個のシード中5つに上昇し、計算リソースの増加が性能向上に寄与することを示した。
- 10,000のオラクル予算下で、強制ブロックを含む生成分子の平均ドッキングスコアは -8.48 ± 0.25(M=2694)であり、高い結合親和性の可能性を示した。
- ドッキングスコアが -10 より低い区間(DS < -10)に属する分子の平均QED値は 0.84 ± 0.10 であり、高い薬物様性を示した。
- QED強制なしでは、成功確率は10個のシード中3つに低下したが、15,000のオラクル予算では4つに上昇した。QEDは有用ではあるが、必須ではない制約であることが示された。
- 10,000のオラクル予算下で、成功した分子の平均反応ステップ数は 3.68 ± 1.08 であり、実現可能な合成経路であることを示した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。