[論文レビュー] Can LLMs Generate Diverse Molecules? Towards Alignment with Structural Diversity
本論文は、事前に生成されたものに条件付けられた自己回帰的生成を可能にするために、教師あり微調整の後に強化学習を適用する二段階微調整手法を提案する。この手法により、大規模言語モデル(LLMs)は構造的に多様な分子を生成できるようになる。従来のデコード手法や最先端のLLMsと比較して、分子の多様性と品質が著しく向上し、より高い多様性スコアと未学習の分子特性プロンプトにおける優れた性能を達成した。
Recent advancements in large language models (LLMs) have demonstrated impressive performance in molecular generation, which offers potential to accelerate drug discovery. However, the current LLMs overlook a critical requirement for drug discovery: proposing a diverse set of molecules. This diversity is essential for improving the chances of finding a viable drug, as it provides alternative molecules that may succeed where others fail in real-world validations. Nevertheless, the LLMs often output structurally similar molecules. While decoding schemes like diverse beam search may enhance textual diversity, this often does not align with molecular structural diversity. In response, we propose a new method for fine-tuning molecular generative LLMs to autoregressively generate a set of structurally diverse molecules, where each molecule is generated by conditioning on the previously generated molecules. Our approach consists of two stages: (1) supervised fine-tuning to adapt LLMs to autoregressively generate molecules in a sequence and (2) reinforcement learning to maximize structural diversity within the generated molecules. Our experiments show that the proposed approach enables LLMs to generate diverse molecules better than existing approaches for diverse sequence generation.
研究の動機と目的
- 創薬に成功するための鍵となる構造的に多様な分子の生成が、現在のLLMsにおいて重要なギャップを埋めるため。
- 既存のデコード手法には、テキストの多様性は向上するが分子構造の多様性は向上しないという限界を克服するため。
- 外部の多様な分子データセットに依存せずに、分子の多様性を向上させる自己改善型の微調整フレームワークを開発するため。
- 以前の出力に条件付けた分子生成により、LLMベースの分子生成のロバスト性を高めるため。
- 分子単位の多様性報酬を用いた強化学習が、他の訓練戦略と比較して優れた多様性を達成することを示すため。
提案手法
- 事前学習済みLLMを、単一のプロンプトから複数の分子のシーケンスを自己回帰的に生成できるように、教師あり微調整で適応させる。
- 訓練データはLLM自身からの反復的サンプリングにより収集され、品質と多様性を向上させるためにフィルタリングされる。
- 分子類似度メトリクス(例:Tanimoto類似度、NCircles)に基づく報酬関数を定義することで、構造的多様性を最大化する強化学習が用いられる。
- 各分子生成を段階として扱い、個々の多様性報酬を付与するマルチステージ強化学習設定が採用される。
- 外部の多様な分子データセットに依存せず、自己生成データを用いてエンドツーエンドでモデルを訓練する。
- SMILES表現を用い、Bertz複雑度、QED、分子フィンガープrintベースの類似度などのメトリクスを用いて多様性を評価する。
実験結果
リサーチクエスチョン
- RQ1LLMsは、類似した構造を繰り返すのではなく、多様な分子の集合を生成できるように微調整可能か?
- RQ2以前に生成された分子に条件付けた分子生成は、構造的多様性を向上させるか?
- RQ3提案手法の二段階微調整法は、ビームサーチ(BS=500)のような標準的なデコード手法と比較して、多様な分子の生成においてどのように異なるか?
- RQ4分子単位の報酬を用いた強化学習は、多様性メトリクスのハードフィルタリングを伴う教師あり微調整を上回るか?
- RQ5マルチステージ強化学習の設定は、単一ステージのリターン定式化と比較して多様性を向上させるか?
主な発見
- 提案手法は顕著に高い構造的多様性を達成し、h=0.65におけるNCirclesスコアが21.98に達し、ベースライン手法を上回った。
- DrugAssistベンチマークにおいて、未学習のQEDベースのプロンプトを含め、すべての分子特性プロンプトにおいて一貫して多様性と品質が向上した。
- 155個の生成分子において、本手法は25.6個のユニークで多様な分子を発見したのに対し、ビームサーチ(BS=500)では21.3個にとどまり、スケーラビリティの優位性が示された。
- ビームサーチ(65秒対585秒)と比較して、時間コストを80%削減しながら、より多様な分子を生成した。
- マルチステージ強化学習は、単一ステージRLおよびハードフィルタードSFTを上回り、より優れたクレジット配分と多様性最適化が可能であることが示された。
- 未学習のプロンプトに対しても高い性能を維持しており、分子生成における優れた一般化性能とロバスト性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。