Skip to main content
QUICK REVIEW

[論文レビュー] DrugLLM: Open Large Language Model for Few-shot Molecule Generation

Xianggen Liu, Yan Guo|arXiv (Cornell University)|May 7, 2024
Computational Drug Discovery Methods被引用数 4
ひとこと要約

DrugLLM は、官能基とその位置を組み合わせた構造的シーケンスとして分子を符号化する Group-based Molecular Representation (GMR) を用いて、少数の修正例からの小分子生成に特化した微調整を施した 70 億パラメータの大規模言語モデルである。このモデルは、わずかな修正例からの新しい分子の生成において最先端の性能を達成しており、従来のディープラーニングおよび LLM ベースラインと比較して、少数ショットおよびゼロショットの両設定で優れた性能を示している。

ABSTRACT

Large Language Models (LLMs) have made great strides in areas such as language processing and computer vision. Despite the emergence of diverse techniques to improve few-shot learning capacity, current LLMs fall short in handling the languages in biology and chemistry. For example, they are struggling to capture the relationship between molecule structure and pharmacochemical properties. Consequently, the few-shot learning capacity of small-molecule drug modification remains impeded. In this work, we introduced DrugLLM, a LLM tailored for drug design. During the training process, we employed Group-based Molecular Representation (GMR) to represent molecules, arranging them in sequences that reflect modifications aimed at enhancing specific molecular properties. DrugLLM learns how to modify molecules in drug discovery by predicting the next molecule based on past modifications. Extensive computational experiments demonstrate that DrugLLM can generate new molecules with expected properties based on limited examples, presenting a powerful few-shot molecule generation capacity.

研究の動機と目的

  • データ不足に起因する従来のディープラーニングモデルの限界を考慮し、創薬における少数ショット分子生成の課題に取り組むこと。
  • 大規模言語モデルが特定の薬理的特性を持つ分子を理解し、生成する能力を向上させること。
  • 新規の分子表現(GMR)を用いて分子の構造-特性関係を捉える手法を開発すること。
  • 限られた修正例から学習することで、効果的な少数ショットおよびゼロショットの分子最適化を可能にすること。
  • 自然言語モデリングと化学的言語の間のギャップを埋めるために、LLM を分子生成タスクに適応させること。

提案手法

  • DrugLLM は、32 層、32 個のアテンションヘッド、4096 の隠れ層次元を持つ変更版 LLaMA アーキテクチャを採用し、分子修正シーケンスのキュレートされたデータセット上で微調整されている。
  • 分子は、SMILES 文字列を構造的断片とその位置インデックスに分解する Group-based Molecular Representation (GMR) を用いて表現されており、解釈可能性の向上とトークンの曖昧さの低減が図られている。
  • 学習の目的は、最適化の説明と分子修正のシーケンスにおける自己回帰的次トークン予測であり、変換パターンの学習が可能になっている。
  • モデルは、各入力シーケンスに目的の特性変更の説明といくつかの例の修正が含まれる、分子修正ケースのデータセット上で微調整されている。
  • 推論時には、DrugLLM は少数の例の修正(少数ショット)またはタスクの説明(ゼロショット)を入力として、次の分子を予測することで新しい分子を生成する。
  • デコードプロセスでは、GMR で符号化された断片と接続および位置情報から分子を再構築することで、構造的正しさと可逆性が保証されている。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルは、高い正確性と化学的妥当性を維持したまま、少数ショット分子生成に効果的に微調整可能だろうか?
  • RQ2Group-based Molecular Representation (GMR) は、標準的な SMILES と比較して、分子構造および修正パターンのモデリングをどの程度改善するのか?
  • RQ3DrugLLM は、わずかな例しか与えられていない状況でも、新しい分子最適化タスクにどの程度一般化可能だろうか?
  • RQ4DrugLLM は、従来の生成的ディープラーニングモデル(例:JTVAE、VJTNN、MoLeR)および汎用的 LLM(例:GPT-4、ChatGLM)と比較して、少数ショット分子生成においてどの程度優れているのか?
  • RQ5DrugLLM は、微調整済みの例が一切ない状況でも、タスクの説明にのみ依存してゼロショットの分子最適化を実行できるだろうか?

主な発見

  • DrugLLM は、JTVAE や VJTNN、MoLeR などのベースラインモデルと比較して、目的の特性を持つ分子を生成するという点で、少数ショット分子生成において最先端の性能を達成している。
  • モデルはゼロショット設定においても強力な一般化能力を示し、クエリ分子とタスクの説明にのみ依存して、化学的に妥当で特性最適化された分子を生成している。
  • GMR を用いた表現は、より正確で解釈可能な分子符号化を可能にし、生成過程における構造的忠実性の向上とトークンの曖昧さの低減を実現している。
  • ドメイン特化の微調整と表現を備えたため、GPT-4 や ChatGLM といった汎用的 LLM でさえ、注意深く設計されたプロンプトを用いても、DrugLLM に及ばない性能を発揮している。
  • ベースラインと比較して、logP、QED、SA スコアなどの特性スコアがより高い分子が生成されており、望ましい医薬品特性の最適化がより良好に行われていることが示された。
  • 広範なアブレーションスタディにより、GMR 表現と少数ショット微調整戦略の両方がモデル性能にとって不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。