Skip to main content
QUICK REVIEW

[論文レビュー] DrugAssist: A Large Language Model for Molecule Optimization

Geyan Ye, Xibao Cai|arXiv (Cornell University)|Dec 28, 2023
Machine Learning in Materials Science被引用数 4
ひとこと要約

DrugAssist は、Llama2-7B-Chat を微調整して、人間と機械の対話による分子最適化を実現するインタラクティブな大規模言語モデルであり、反復的で専門家による誘導による精錬を可能にする。単一および複数の特性最適化、範囲制約付きの目的関数を含め、最先端の性能を達成しており、ゼロショットおよびフェイントショットの転送性にも優れている。

ABSTRACT

Recently, the impressive performance of large language models (LLMs) on a wide range of tasks has attracted an increasing number of attempts to apply LLMs in drug discovery. However, molecule optimization, a critical task in the drug discovery pipeline, is currently an area that has seen little involvement from LLMs. Most of existing approaches focus solely on capturing the underlying patterns in chemical structures provided by the data, without taking advantage of expert feedback. These non-interactive approaches overlook the fact that the drug discovery process is actually one that requires the integration of expert experience and iterative refinement. To address this gap, we propose DrugAssist, an interactive molecule optimization model which performs optimization through human-machine dialogue by leveraging LLM's strong interactivity and generalizability. DrugAssist has achieved leading results in both single and multiple property optimization, simultaneously showcasing immense potential in transferability and iterative optimization. In addition, we publicly release a large instruction-based dataset called MolOpt-Instructions for fine-tuning language models on molecule optimization tasks. We have made our code and data publicly available at https://github.com/blazerye/DrugAssist, which we hope to pave the way for future research in LLMs' application for drug discovery.

研究の動機と目的

  • 既存の LLM ベースのアプローチにおいて、インタラクティブで専門家のフィードバックに依存する分子最適化の欠如に対処する。
  • ドメインエキスパートと LLM の間でリアルタイムで複数回のやり取りを行う対話型環境を実現し、分子特性を段階的に改善する。
  • 指定された値の範囲内で最適化を実行できるモデルを開発する。
  • ゼロショットおよびフェイントショット最適化により、転送性を向上させる。
  • 将来的な研究を促進するため、微調整用に利用可能な大規模なインstructベースのデータセット、MolOpt-Instructions を公開する。

提案手法

  • 分子最適化タスク向けに、大規模なインstructベースのデータセットである MolOpt-Instructions を用いて Llama2-7B-Chat を微調整する。
  • 分子を SMILES 文字列で表現し、自然言語による指示に従って条件付き生成タスクとして最適化を定式化する。
  • ユーザーがフィードバックや新たな最適化目標を提示できる複数回のやり取りをサポートし、段階的な改善を可能にする。
  • ユーザーによる出力の是正を通じて専門家のフィードバックを統合し、望ましい分子特性へ向かう生成を誘導する。
  • トレーニング中に確認されていない新しい特性の組み合わせに対しても一般化することで、ゼロショット転送を可能にする。
  • 成功事例の少数例を活用することで、新しい未確認の特性の最適化をモデルがガイドできるようにする。

実験結果

リサーチクエスチョン

  • RQ1LLM ベースのモデルは、ドメインエキスパートとの自然言語対話によって、インタラクティブかつ反復的な分子最適化を効果的に支援できるか?
  • RQ2特に特定の値の範囲内で最適化する際、モデルは多特性最適化タスクにどの程度一般化できるか?
  • RQ3トレーニングデータに含まれない特性の最適化に、モデルはどの程度知識を転送できるか?
  • RQ4複数回のやり取りの文脈で、人間が提供するフィードバックにより、モデルは自身の誤りをどの程度効果的に是正できるか?
  • RQ5微調整された LLM は、優れた転送性と相互作用性を維持しつつ、分子最適化分野で最先端のパフォーマンスを達成できるか?

主な発見

  • DrugAssist は、範囲制約付きの目的関数を含め、単一および多特性最適化の両方で最先端のパフォーマンスを達成している。
  • モデルは強いゼロショット転送性を示し、再トレーニングなしで未確認の特性の組み合わせを効果的に最適化している。
  • フェイントショット設定では、トレーニングデータに存在しなかった新しい特性(例:logP)を、少数のデモンストレーション例を活用して最適化できる。
  • モデルは反復的最適化の能力が強く、初期の出力が基準を満たさない場合、人間が提供する例に基づいてアプローチを是正する。
  • DrugAssist は、多様な最適化タスクにおいて高い妥当性と成功確率を維持しており、従来の LLM ベースおよび伝統的手法を常に上回る結果を示している。
  • 公開済みの MolOpt-Instructions データセットは、類似性および特性の差異制約を満たす分子最適化のための LLM の微調整に十分なデータ多様性を備えている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。