[論文レビュー] Molecular De Novo Design through Deep Reinforcement Learning
本論文では、SMILESに基づく系列生成モデル(ChEMBLから学習したRNN)を、拡張エピソード尤度を用いて所望の性質を持つ分子にファインチューニングするための深層強化学習フレームワーク、REINVENTを提案する。この手法は、従来のREINFORCEおよび先行するRLアプローチを著しく上回り、DRD2に対して95%以上の予測活性成分を生成し、訓練中に確認されていなかった既知の活性成分を回復する。
This work introduces a method to tune a sequence-based generative model for molecular de novo design that through augmented episodic likelihood can learn to generate structures with certain specified desirable properties. We demonstrate how this model can execute a range of tasks such as generating analogues to a query structure and generating compounds predicted to be active against a biological target. As a proof of principle, the model is first trained to generate molecules that do not contain sulphur. As a second example, the model is trained to generate analogues to the drug Celecoxib, a technique that could be used for scaffold hopping or library expansion starting from a single molecule. Finally, when tuning the model towards generating compounds predicted to be active against the dopamine receptor type 2, the model generates structures of which more than 95% are predicted to be active, including experimentally confirmed actives that have not been included in either the generative model nor the activity prediction model.
研究の動機と目的
- 特定の望ましい性質(例:生物学的活性、ドラッグライクネス)を持つ分子を生成できる分子デ・ノボ設計手法の開発。
- ルールベースや逆相関QSAR手法の制限を克服するため、厳密な反応または変換ルールを避けるデータ駆動型で柔軟なアプローチを採用。
- 強化学習による分子生成の既存手法を改善するため、訓練の安定化と事前知識の保持を図るために、拡張エピソード尤度を導入。
- クエリ分子(例:セレコキシブ)のアナログを生成できること、および訓練データに含まれない生物学的ターゲット(例:DRD2)に対して実験的に確認された活性成分を発見できることを示す。
提案手法
- ChEMBLのSMILES文字列から学習した事前学習済みRNN(Prior)を、化学的に妥当な分子の分布をモデル化するために用いる。
- エージェントネットワークは、Priorのコピーとして初期化され、所望の性質を持つ分子を生成するため強化学習によってファインチューニングされる。
- 本手法は、拡張エピソード尤度を用いる。これは、事前分布の尤度と分子性質に基づく報酬信号を組み合わせた、政策勾配の変種である。
- 報酬関数は、活性、cLogP、QEDなどの性質についてスコアを付ける予測モデル(例:SVMまたはDNN)によって定義される。
- エージェントは、トークンの系列における時間軸に沿ったバックプロパゲーション(BPTT)を用いて、政策勾配最適化により訓練される。
- 本手法はハイパーパrameterに対して頑健であり、手動による報酬形状の調整を必要とせず、報酬の悪用のリスクを低減する。
実験結果
リサーチクエスチョン
- RQ1深層強化学習フレームワークは、特定の望ましい性質を持つ分子を生成するために、生成用RNNを効果的にファインチューニングできるか?
- RQ2拡張エピソード尤度は、従来のREINFORCEおよび先行するRL手法と比較して、分子生成タスクにおいてどのように性能を発揮するか?
- RQ3訓練データに含まれないにもかかわらず、クエリ分子(例:セレコキシブ)の高品質なアナログをモデルが生成できるか?
- RQ4生成モデルや活性予測モデルに含まれていないにもかかわらず、生物学的ターゲット(例:DRD2)に対して実験的に確認された活性成分をモデルが発見できるか?
- RQ5学習率やノイズスケールσなどのハイパーパrameterの変動に対して、本手法はどの程度頑健か?
主な発見
- モデルはドーパミンD2受容体に対して、95%を超える分子が予測活性成分であると生成し、ランダムサンプリングやベースライン手法を著しく上回った。
- 訓練データに含まれない既知のDRD2に対する活性化合物を、モデルは成功裏に回復した。
- 従来のREINFORCEおよび先行するRL手法と比較して、本手法は特に、事前分布を保持しながら新しい目的を学習する点で優れた性能を示した。
- モデルは、訓練セットにないにもかかわらず、セレコキシブの構造的に多様なアナログを生成し、化学空間の効果的な探索を示した。
- 本手法はハイパーパrameterの設定に対して頑健であり、学習率やノイズスケールσの異なる値に対しても一貫した性能を示した。
- 拡張エピソード尤度の使用により、安定した訓練が可能となり、報酬のみに依存するRL手法とは異なり、事前知識の消失のリスクが低減された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。