[論文レビュー] Multimodal Large Language Models for Inverse Molecular Design with Retrosynthetic Planning
Llamoleは、逆相反合成計画を伴う、入れ違いのテキストおよびグラフ生成を可能にする最初のマルチモーダル大規模言語モデル(MLLM)である。ベースとなるLLMにグラフ拡散変換器とGNNを統合し、LLMに基づくヒューリスティクスを用いたA*探索を適用することで、Llamoleは逆相反合成計画において35%の成功率を達成した。これは従来のモデルが5.5%であったのと比較して顕著な向上であり、12の指標において分子設計のパフォーマンスを最大80.9%向上させた。
While large language models (LLMs) have integrated images, adapting them to graphs remains challenging, limiting their applications in materials and drug design. This difficulty stems from the need for coherent autoregressive generation across texts and graphs. To address this, we introduce Llamole, the first multimodal LLM capable of interleaved text and graph generation, enabling molecular inverse design with retrosynthetic planning. Llamole integrates a base LLM with the Graph Diffusion Transformer and Graph Neural Networks for multi-conditional molecular generation and reaction inference within texts, while the LLM, with enhanced molecular understanding, flexibly controls activation among the different graph modules. Additionally, Llamole integrates A* search with LLM-based cost functions for efficient retrosynthetic planning. We create benchmarking datasets and conduct extensive experiments to evaluate Llamole against in-context learning and supervised fine-tuning. Llamole significantly outperforms 14 adapted LLMs across 12 metrics for controllable molecular design and retrosynthetic planning.
研究の動機と目的
- 従来のLLMがグラフ構造の分子データに対して苦労する中で、特定の性質と合成可能性を持つ分子を生成するという課題に対処すること。
- テキストと分子グラフの入れ違い生成が可能なマルチモーダルLLMを構築し、制御可能な逆分子設計を可能にすること。
- 効率的な逆相反合成経路計画のため、LLMに基づくコスト関数とA*探索を統合すること。
- マルチモーダル生成を評価するため、現実的で人間らしい分子設計指示を含むベンチマークデータセットを構築すること。
- テキスト中心のLLMとグラフベースの手法の限界を克服し、統一された自己回帰フレームワークにより両者の長所を統合すること。
提案手法
- Llamoleは、ベースLLMに、複数の条件付き分子生成に適したグラフ拡散変換器(Graph DiT)と反応テンプレート予測に適したGNNを統合する。
- 特別なトークンを用いたトリガー・クエリ・予測メカニズムにより、自己回帰的生成中にグラフモジュールを活性化し、テキストとグラフの入れ違い生成を実現する。
- 分子または反応が生成された後、ベースLLMは、以前に生成された分子構造を符号化するグラフエンコーダーを介して、テキスト生成を再開する。
- 逆相反合成計画のため、LlamoleはLLMで計算されたヒューリスティクスを用いたA*探索を採用し、広大な反応空間を効率的に探索する。
- 生成を語彙、原子/結合種別、反応テンプレートの多クラス分類タスクとして定式化する。
- 人間の会話風プロンプトと逆相反合成経路を含む、多モーダル分子設計指示の収集済みデータセットを用いて微調整を実施する。

実験結果
リサーチクエスチョン
- RQ1マルチモーダルLLMは、制御可能な逆分子設計のため、テキストと分子グラフの整合的で入れ違いの生成を達成できるか?
- RQ2LLMとグラフモデルを統合することで、テキスト中心のLLMと比較して、分子生成における制御性と品質はどの程度向上するか?
- RQ3グラフ統合付きLLMは、純粋なLLMおよびグラフベースのベースラインと比較して、逆相反合成計画においてどの程度優れた性能を示すか?
- RQ4LLMに基づくヒューリスティクスで誘導されるA*探索は、多段階の逆相反合成のための広大な反応空間を効率的に探索できるか?
- RQ5提案されたフレームワークは、複雑な複数性質要件を満たす分子の生成において、どの程度有効であるか?
主な発見
- Llamoleは逆相反合成計画において35%の成功率を達成した。これは、最良のベースラインモデルが5.5%であったのと比較して顕著な向上である。
- 14の適応済みLLMと比較して、Llamoleは制御可能な分子設計の12の指標において最大80.9%のパフォーマンス向上を達成した。
- 反応条件のテキスト生成において、LlamoleはROUGE-Lスコアが0.268と最高を記録し、構造的整合性が優れている。これは、有効な反応条件の多様性のため、BLEU-4スコアは低めにとどまるが、その影響を受けていない。
- 事例研究では、Llamoleが化学的に妥当で合成可能な分子を、複雑な要件を満たす形で生成した一方、ICLおよびSFTベースラインは幻覚的または無効な構造を生成した。
- ポリマー設計の文脈では、Llamoleは所望の性質を持つ有効なモノマー構造と2段階の逆相反合成経路を正常に生成したが、ベースラインは有効なポリマーを生成できず、指示に従うこともできなかった。
- Llamoleは、小分子からポリマーに至る多様な分子種にわたり、優れた指示遵守性と化学的妥当性を示し、強固な性能を発揮した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。