[論文レビュー] De novo PROTAC design using graph-based deep generative models
本論文では、勾配強化学習を用い、勾配強化学習の報酬関数として勾配ブースティングツリーのスレーブモデルを用いて劣化活性予測を行うことで、空のグラフから完全に新しいPROTAC様分子を生成するグラフベースの深層生成モデルを提示する。微調整後、予測された劣化活性がIRAK3で50%から80%以上に向上し、化学的妥当性はほぼ100%を維持した。これは、140個の重い原子を有する大規模で複雑なPROTACの有効な生成を示している。
PROteolysis TArgeting Chimeras (PROTACs) are an emerging therapeutic modality for degrading a protein of interest (POI) by marking it for degradation by the proteasome. Recent developments in artificial intelligence (AI) suggest that deep generative models can assist with the de novo design of molecules with desired properties, and their application to PROTAC design remains largely unexplored. We show that a graph-based generative model can be used to propose novel PROTAC-like structures from empty graphs. Our model can be guided towards the generation of large molecules (30--140 heavy atoms) predicted to degrade a POI through policy-gradient reinforcement learning (RL). Rewards during RL are applied using a boosted tree surrogate model that predicts a molecule's degradation potential for each POI. Using this approach, we steer the generative model towards compounds with higher likelihoods of predicted degradation activity. Despite being trained on sparse public data, the generative model proposes molecules with substructures found in known degraders. After fine-tuning, predicted activity against a challenging POI increases from 50% to >80% with near-perfect chemical validity for sampled compounds, suggesting this is a promising approach for the optimization of large, PROTAC-like molecules for targeted protein degradation.
研究の動機と目的
- 大規模で複雑な二機能性分子であるPROTACのde novo分子生成フレームワークの開発。
- 公開データが乏しいにもかかわらず、高い劣化可能性を有するPROTACの設計の課題への対処。
- 初期構造のサブストラクチャを必要とせず、原子1つずつでPROTAC様構造を生成することの実現。
- 強化学習を用いて、予測された高い劣化活性を有する分子の生成確率を向上させること。
- 解釈可能な機械学習と生成モデルを用いた、オープンソースで再現可能なin silico PROTAC設計ワークフローの提供。
提案手法
- グラフベースの深層生成モデル(GraphINVENT)を用い、化学的結合価則と接続ルールを学習することで、空のグラフから原子1つずつでPROTAC様分子を生成する。
- 公開PROTACデータを用いて勾配ブースティングツリーのスレーブモデルを学習し、劣化活性(DC50)をスカラー得点として予測し、強化学習の報酬関数として用いる。
- ポリシー勾配強化学習を適用し、より高い予測劣化活性を示す分子へと生成モデルを誘導する。マルチオブジェクティブスコア関数を用いる。
- 200ステップの強化学習ステップを用いた微調整により、予測活性と化学的妥当性の両方を最適化する。
- 本手法をIRAK3標的に対して適用し、事前定義されたサブス トラクチャ制約なしに、新規PROTAC様構造を生成する。
- 生成された分子は、既知のデグレーダーとのサブス トラクチャ類似度および化学的妥当性(最終モデルで100%)について評価される。
実験結果
リサーチクエスチョン
- RQ1グラフベースの深層生成モデルは、初期サブス トラクチャを必要とせず、空のグラフから完全に新しいPROTAC様分子を生成できるか?
- RQ2劣化活性予測のためのスレーブモデルを用いた強化学習は、生成された分子における予測活性分子の割合を向上させられるか?
- RQ3限られた公開PROTACデータにのみ学習させたモデルが、既知のデグレーダーに見られるサブス トラクチャを有する、化学的に妥当で大規模な分子(30〜140個の重い原子)をどれほど効果的に生成できるか?
- RQ4限られたかつ不均衡な公開データに学習させた勾配ブースティングツリーのスレーブモデルは、PROTACの劣化可能性(DC50)をどれほど正確に予測できるか?
- RQ5ポリシー勾配強化学習にメモリを考慮した損失関数を統合することで、高活性PROTAC候補の生成が向上するか?
主な発見
- グラフベースの深層生成モデルは、最大139個の重い原子を有するPROTAC様分子を生成でき、最終的な微調整モデルでは化学的妥当性が100%に達した。
- 200ステップの強化学習を経て、IRAK3に対する予測活性分子の割合が53%から82%に上昇した。
- モデルの最終出力は、挑戦的なIRAK3標的に対して80%を超える予測劣化活性率を達成し、初期の50%ベースラインから著しく向上した。
- 上位で生成された分子は、protac-dbに登録された既知のPROTACデグレーダーに共通するサブス トラクチャを含んでおり、生物学的関連性を示した。
- スレーブモデルはDC50予測においてテストAUCが0.87を達成したが、公開データが乏しく不均衡であるため一般化能は限定的である。
- 生成された分子は100%新規であり、トレーニング化合物との構造的重複がないため、真のde novo設計能力が確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。