Skip to main content
QUICK REVIEW

[論文レビュー] MolecularGPT: Open Large Language Model (LLM) for Few-Shot Molecular Property Prediction

Yuyan Liu, Sirui Ding|arXiv (Cornell University)|Jun 18, 2024
Machine Learning in Materials Science被引用数 10
ひとこと要約

MolecularGPT は、少数ショット分子特性予測用に設計された命令調整済みのオープンLLMで、構造認識型の少数ショット指示とゼロショット/少数ショットのハイブリッドプロンプトセットを用いて、未知のMPPタスクに一般化します。競合的なゼロショット性能と、複数のベンチマークで優れた少数ショット性能を発揮し、いくつかのベースラインを上回ります。

ABSTRACT

Molecular property prediction (MPP) is a fundamental and crucial task in drug discovery. However, prior methods are limited by the requirement for a large number of labeled molecules and their restricted ability to generalize for unseen and new tasks, both of which are essential for real-world applications. To address these challenges, we present MolecularGPT for few-shot MPP. From a perspective on instruction tuning, we fine-tune large language models (LLMs) based on curated molecular instructions spanning over 1000 property prediction tasks. This enables building a versatile and specialized LLM that can be adapted to novel MPP tasks without any fine-tuning through zero- and few-shot in-context learning (ICL). MolecularGPT exhibits competitive in-context reasoning capabilities across 10 downstream evaluation datasets, setting new benchmarks for few-shot molecular prediction tasks. More importantly, with just two-shot examples, MolecularGPT can outperform standard supervised graph neural network methods on 4 out of 7 datasets. It also excels state-of-the-art LLM baselines by up to 15.7% increase on classification accuracy and decrease of 17.9 on regression metrics (e.g., RMSE) under zero-shot. This study demonstrates the potential of LLMs as effective few-shot molecular property predictors. The code is available at https://github.com/NYUSHCS/MolecularGPT.

研究の動機と目的

  • 従来の教師付きMPPとオープンLLMsのギャップを埋めるため、分子指示でLLMをファインチューニングして、未知のMPPタスクに一般化する。
  • SMILESベースの指示チューニングと構造認識型の少数ショットデモンストレーションを活用して、分子グラフ情報を組み込む。
  • MPPにおけるゼロショットと少数ショットのインコンテキスト学習能力のバランスを取るハイブリッド指示セットを探求する。
  • 多様なデータセットで評価して、少数ショットのベンチマークを確立し、指示設計の影響を分析する。

提案手法

  • SMILES を用いて分子グラフを統一された文字列表現に変換し、指示の構築に用いる。
  • MACCS/ Tanimoto類似度を用いて上位K個の類似分子を取得し、それをプロンプト内のデモンストレーションとして用いる、構造認識型の少数ショット指示を導入する。
  • ゼロショットと少数ショットのテンプレートを組み合わせたハイブリッド指示チューニング規制を開発し、ゼロショット推論を保持しつつ強力な少数ショットI CLを可能にする。
  • 構築された指示セットを用いて、事前学習済みLLM (LLaMA2-7b-chat) を QLoRA でファインチューニングし、1000超のMPPタスクに渡って適用する。
  • 分類には ROC-AUC、回帰には RMSE を用いて10の下流データセットを評価し、GNNベースラインおよびより大きなLLMベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1RQ1: MolecularGPT は、ゼロショットおよび少数ショット ICL を通じて、新しい性質予測タスクを効果的かつ頑健に処理できるか?
  • RQ2RQ2: ファインチューニング時に MolecularGPT の一般化と ICL 能力を向上させるための、インコンテキスト指示セットの最適設計は何か?
  • RQ3RQ3: インコンテキスト例の数、順序、および多様性は、MolecularGPT の性能にどのように影響するか?

主な発見

  • MolecularGPT は他の言語モデルと比較して競合的なゼロショット性能を示し、いくつかのデータセットで GIMLET および LLaMA ベースのベースラインを上回る。
  • 2ショットのデモンストレーションを用いると、MolecularGPT は7データセットのうち4つで標準的な教師ありGNN法を上回り、2ショット条件下でBBBP に対して finetuned Graphormer-p に匹敵するかそれを上回る。
  • MolecularGPT は分類タスク全体で ROC-AUC の平均最大16.6%の改善を達成し、ゼロショット下で堅牢なLLMベースラインと比較して回帰の RMSE を大幅に低減する。
  • ゼロショットと少数ショットのプロンプトを組み合わせたハイブリッド指示セットは、タスクを横断してゼロショットおよび少数ショットの性能を一貫して向上させる。
  • より大きな指示セットと混合ショットの調整は性能を向上させ、取得されたデモンストレーションは、クエリとの類似度が高い順にランク付けされたときに最も効果的。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。