[論文レビュー] Large Language Models are Zero Shot Hypothesis Proposers
本稿では、大規模言語モデル(LLMs)が、生物学的医学文献を用いて、事前学習なしのゼロショット設定で科学的に妥当で、かつ新規の仮説を生成できるかどうかを調査している。研究では、訓練用と未学習のテスト用に時系列的に分割されたデータセットを構築し、役割別に協働するマルチエージェントフレームワーク(アナリスト、エンジニア、科学者、批評者)を採用した。その結果、LLMsは学習されていないが検証済みの仮説を提示できることが判明した。特に不確実性を高めた場合に顕著で、LLMsが科学的発見の促進要因となり得ることを示唆している。
Significant scientific discoveries have driven the progress of human civilisation. The explosion of scientific literature and data has created information barriers across disciplines that have slowed the pace of scientific discovery. Large Language Models (LLMs) hold a wealth of global and interdisciplinary knowledge that promises to break down these information barriers and foster a new wave of scientific discovery. However, the potential of LLMs for scientific discovery has not been formally explored. In this paper, we start from investigating whether LLMs can propose scientific hypotheses. To this end, we construct a dataset consist of background knowledge and hypothesis pairs from biomedical literature. The dataset is divided into training, seen, and unseen test sets based on the publication date to control visibility. We subsequently evaluate the hypothesis generation capabilities of various top-tier instructed models in zero-shot, few-shot, and fine-tuning settings, including both closed and open-source LLMs. Additionally, we introduce an LLM-based multi-agent cooperative framework with different role designs and external tools to enhance the capabilities related to generating hypotheses. We also design four metrics through a comprehensive review to evaluate the generated hypotheses for both ChatGPT-based and human evaluations. Through experiments and analyses, we arrive at the following findings: 1) LLMs surprisingly generate untrained yet validated hypotheses from testing literature. 2) Increasing uncertainty facilitates candidate generation, potentially enhancing zero-shot hypothesis generation capabilities. These findings strongly support the potential of LLMs as catalysts for new scientific discoveries and guide further exploration.
研究の動機と目的
- 大規模言語モデル(LLMs)が、ファインチューニングを施さずに、ゼロショット設定で科学的に妥当な仮説を生成できるかどうかを調査すること。
- 生物学的医学文献の爆発的増加に伴い生じる情報の島嶋化や科学的発見の遅延という課題に対処すること。
- 厳密なゼロショット評価を可能にするために、背景知識と仮説のペアで構成される時系列的データセットを構築すること。
- 役割別に分担するエージェント(アナリスト、エンジニア、科学者、批評者)を有するマルチエージェント協働フレームワークを設計・評価し、仮説生成の質を向上させること。
- LLMおよび人間による評価を想定し、新規性、関連性、重要性、検証可能性の4つの新しい評価指標を構築・検証すること。
提案手法
- 2000年1月から2023年9月までの文献から生物学的医学データセットを構築し、発表日で分割して訓練用(2023年1月以前)、確認用(2023年1月〜7月)、未学習のテスト用(2023年8月〜9月)に分類した。
- 未学習のテストセットを用いて、上位レベルの指示付きLLMs(GPT-4 やファインチューニング済みLLaMAを含む)を、ゼロショット、少数ショット、ファインチューニングの設定で評価した。
- 以下の役割を持つマルチエージェント協働フレームワークを設計した:アナリスト(主要な概念を抽出)、エンジニア(体系的な文献サーチを実施)、科学者(仮説を形成)、批評者(仮説を評価・精錬)。
- 構造化されたプロンプトと役割別指示に従い、エージェント間の反復的フィードバックループを実装し、仮説を精錬した。
- GPT-4をジャッジとして用い、一貫性を保つために標準化された段階的プロンプトを用いて、新規性、関連性、重要性、検証可能性の4つの評価指標を定義した。
- 不確実性の調整(例:マルチエージェント協働による)を実施し、ゼロショット生成における仮説の多様性と質に与える影響を調査した。

実験結果
リサーチクエスチョン
- RQ1LLMsは、テストデータに接触していないゼロショット設定でも、科学的に妥当で新規の仮説を生成できるか?
- RQ2仮説生成中に不確実性を高めることで、生成された仮説の多様性と質はどのように変化するか?
- RQ3マルチエージェント協働フレームワークは、単一エージェントのプロンプト提示に比べて、仮説の質をどの程度向上させるか?
- RQ4異なるLLMアーキテクチャとファインチューニング戦略は、ゼロショット仮説生成性能においてどのように比較されるか?
- RQ5外部ツール(例:検索)や少々ショット例の有無は、モデルのゼロショット仮説生成における一般化能力にどのような影響を与えるか?
主な発見
- LLMsは、学習されていないが検証済みの科学的仮説をゼロショット設定で生成でき、科学的発見の促進要因としての可能性を示している。
- マルチエージェント協働による不確実性の増大が、仮説生成の多様性を高めるとともに、ゼロショット性能を改善し、不確実性が創造性を支援することを示唆している。
- 外部ツールや少々ショットファインチューニングの使用は、不確実性を低下させることで、仮説生成の質を低下させる可能性があり、モデルの探索的領域を制限する。
- 役割別貢献とフィードバックループを可能にするマルチエージェントフレームワークは、仮説の質を顕著に向上させた。
- GPT-4を用いて新規性、関連性、重要性、検証可能性をスコア付けする本研究の評価フレームワークは、LLMが生成する仮説を信頼性高く一貫して評価するための有効な手法を提供している。
- ファインチューニング済み65B LLaMAモデルは、既存の文献の発見と密接に一致する仮説を生成でき、フレームワークの有効性を検証した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。