[論文レビュー] From Generalist to Specialist: A Survey of Large Language Models for Chemistry
本調査は、化学分野に特化した大規模言語モデル(LLM)を体系的にレビューし、分野固有の知識の統合、マルチモーダルデータ(2D/3D 構造、スペクトル)およびツール利用機能に焦点を当てている。一般向け LLM を化学分野特化型エージェントに変換するための手法の分類を提唱し、ベンチマークを評価し、化学分野における科学的発見を促進するための主な課題と今後の方向性を同定している。
Large Language Models (LLMs) have significantly transformed our daily life and established a new paradigm in natural language processing (NLP). However, the predominant pretraining of LLMs on extensive web-based texts remains insufficient for advanced scientific discovery, particularly in chemistry. The scarcity of specialized chemistry data, coupled with the complexity of multi-modal data such as 2D graph, 3D structure and spectrum, present distinct challenges. Although several studies have reviewed Pretrained Language Models (PLMs) in chemistry, there is a conspicuous absence of a systematic survey specifically focused on chemistry-oriented LLMs. In this paper, we outline methodologies for incorporating domain-specific chemistry knowledge and multi-modal information into LLMs, we also conceptualize chemistry LLMs as agents using chemistry tools and investigate their potential to accelerate scientific research. Additionally, we conclude the existing benchmarks to evaluate chemistry ability of LLMs. Finally, we critically examine the current challenges and identify promising directions for future research. Through this comprehensive survey, we aim to assist researchers in staying at the forefront of developments in chemistry LLMs and to inspire innovative applications in the field.
研究の動機と目的
- 一般向け LLM が化学分野で示す限界を克服するため、分野知識、マルチモーダルデータ、およびツール統合に関する主な課題を特定すること。
- 事前学習、微調整、およびツール補強推論を用いた一般 LLM を化学特化型 LLM に変換するための包括的な分類法を提供すること。
- テキスト、構造、スペクトルモダリティを含む、化学特化型 LLM の能力を評価するための既存のベンチマークおよびデータセットを評価すること。
- 分子エディターやシミュレーションエンジンなどの化学ツールを活用して、自律的エージェントとしての LLM の役割を検討すること。
- データ不足、モデルの整合性、マルチモーダル推論といった分野における未解決の課題と今後の研究方向性を同定すること。
提案手法
- 一般向け LLM の化学分野への適応を、3 つの核心的課題に分類する:分野知識統合、マルチモーダルデータ処理(1D シーケンス、2D グラフ、3D 構造、スペクトル)、およびツール利用。
- 事前学習、教師あり微調整(SFT)、人間フィードバックを用いた強化学習(RLHF)を主な適応戦略としてレビューし、SFT はタスク固有およびマルチタスク設定にさらに分類する。
- 2D 分子グラフ(例:InstructMol、MolTC)、3D 構造(例:3D-MoLM)、画像(例:ChemVLM、MM-RCR)を処理するマルチモーダル LLM を分析する。
- 分子生成器、反応予測ツール、シミュレーションエンジン(例:Coscientist、ChemCrow、LLaMP)などの外部ツールを活用するツール補強 LLM を検討する。
- 計画立案、知識取得、構造化されたツールを用いたアクション実行を行うエージェントとしての化学 LLM のモデル化フレームワークを提唱する。
- テキスト、スペクトル、画像のモダリティおよび複数のタスク(選択肢形式、直接回答)をカバーする 14 以上のベンチマーク(例:ChemLLMBench、MassSpecGym、ScholarChemQA)をレビューする。

実験結果
リサーチクエスチョン
- RQ1分野固有の知識統合を通じて、一般向け LLM が複雑な化学特化タスクを効果的に処理できるようになる方法は何か?
- RQ22D/3D 分子構造、スペクトル、画像などのマルチモーダルデータを化学志向 LLM に統合するための最も効果的な手法は何か?
- RQ3分子ツール(例:分子エディタ、シミュレーションエンジン)を活用することで、LLM が科学的推論や合成計画立案において自律的エージェントとして機能できる程度はどの程度か?
- RQ4既存のベンチマークを用いた化学 LLM の評価における現在の制限要因やボトルネックは何か?
- RQ5化学 LLM の最先端技術を進歩させるために、最も有望な今後の研究方向性は何か?
主な発見
- 一般向け LLM は分野知識が不十分なため、反応予測、物性計算、命名の分野で誤りを生じやすく、化学タスクにおいて性能を発揮できない。
- 3D-MoLM や ChemVLM といったマルチモーダル LLM は 3D 構造および画像ベースのタスクで性能向上を示しているが、依然としてデータ不足とアノテーション品質の低さに制限を受ける。
- SFT を用いたモデル(例:LlaSMol、ChemDFM)は分子物性予測および反応生成タスクで優れた性能を示し、ゼロショットプロンプティングに比べて精度が向上している。
- ChemCrow や LLaMP といったツール補強 LLM は、外部ツールを統合することで、レトロシンセシスや試薬予測といった複雑なタスクで顕著な向上を示している。
- MassSpecGym や ScholarChemQA といったベンチマークは、LLM がスペクトル解釈や分野固有の推論において依然として困難を抱えており、分布シフトの条件下でも同様であることを示している。
- 本調査では、特に現実的な分子画像や反応スキームを含む、オープンで大規模なマルチモーダルデータセットの欠如が顕著なギャップであると同定している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。