[논문 리뷰] Large Language Models as Biomedical Hypothesis Generators: A Comprehensive Evaluation
이 논문은 데이터 泄漏를 방지하기 위해 배경-가설 쌍의 시간적 분할 데이터셋을 사용하여 대규모 언어 모델(Large Language Models, LLMs)을 생물의학적 가설 생성기로 평가한다. LLMs가 제로샷 설정에서도 새로운, 타당하고 검증 가능한 가설을 생성할 수 있음을 입증하며, 다중 에이전트 협업과 도구 사용이 가설의 다양성과 성능을 향상시키지만, 외부 지식 통합이 항상 성능 향상으로 이어지는 것은 아님을 보여준다.
The rapid growth of biomedical knowledge has outpaced our ability to efficiently extract insights and generate novel hypotheses. Large language models (LLMs) have emerged as a promising tool to revolutionize knowledge interaction and potentially accelerate biomedical discovery. In this paper, we present a comprehensive evaluation of LLMs as biomedical hypothesis generators. We construct a dataset of background-hypothesis pairs from biomedical literature, carefully partitioned into training, seen, and unseen test sets based on publication date to mitigate data contamination. Using this dataset, we assess the hypothesis generation capabilities of top-tier instructed models in zero-shot, few-shot, and fine-tuning settings. To enhance the exploration of uncertainty, a crucial aspect of scientific discovery, we incorporate tool use and multi-agent interactions in our evaluation framework. Furthermore, we propose four novel metrics grounded in extensive literature review to evaluate the quality of generated hypotheses, considering both LLM-based and human assessments. Our experiments yield two key findings: 1) LLMs can generate novel and validated hypotheses, even when tested on literature unseen during training, and 2) Increasing uncertainty through multi-agent interactions and tool use can facilitate diverse candidate generation and improve zero-shot hypothesis generation performance. However, we also observe that the integration of additional knowledge through few-shot learning and tool use may not always lead to performance gains, highlighting the need for careful consideration of the type and scope of external knowledge incorporated. These findings underscore the potential of LLMs as powerful aids in biomedical hypothesis generation and provide valuable insights to guide further research in this area.
연구 동기 및 목표
- 이전 연구에서 발생한 데이터 오염 문제를 해결하고, 제로샷 및 팔문샷 생물의학적 가설 생성에서 LLMs를 철저히 평가하는 것.
- 출판 일자를 기반으로 시간적 분할된 배경-가설 쌍 데이터셋을 구축하여 테스트 세트의 은폐성을 확보하는 것.
- GPT-4 평가를 위한 구조화된 프롬프트를 사용하여 인간 및 LLM 평가를 기반으로 한 네 가지 신규 메트릭(신규성, 관련성, 중요도, 검증 가능성)을 개발하고 검증하는 것.
- 도구 사용과 다중 에이전트 협업을 통한 불확실성 탐색이 가설 생성의 다양성과 성능에 미치는 영향을 탐색하는 것.
- 외부 지식(예: 팔문샷 예시, 도구)이 LLM 기반 가설 생성에 언제 그리고 어떻게 향상 또는 저해하는지에 대한 실질적인 통찰을 제공하는 것.
제안 방법
- 문헌에서 생물의학적 가설 데이터셋을 구축하고, 출판 일자를 기반으로 훈련, 볼 수 있는, 그리고 볼 수 없는 테스트 세트로 분할하여 데이터 泄漏를 방지하는 것.
- 데이터셋을 사용하여 최상위 지시형 LLMs를 제로샷, 팔문샷, 미세조정 설정에서 평가하는 것.
- 불확실성 하에서 협업적 가설 생성을 시뮬레이션하기 위해 각기 다른 역할(과학자, 분석가, 엔지니어, 비평가)을 가진 다중 에이전트 프레임워크를 설계하는 것.
- 가설의 다양성과 품질에 미치는 영향을 탐색하기 위해 다중 에이전트 설정 내에서 도구 사용(예: 검색, 검색)을 통합하는 것.
- GPT-4 평가를 위한 구조화된 프롬프트를 사용하여 인간 및 LLM 애너테이션 기반의 네 가지 메트릭(신규성, 관련성, 중요도, 검증 가능성)을 제안하는 것.
- 배치 크기가 8이고 시퀀스 길이가 2048 토큰인 3 에포크 동안 조기 정지 기법을 사용하여 65B LLaMA 모델을 미세조정하는 것.

실험 결과
연구 질문
- RQ1LLMs는 훈련 기간 동안 볼 수 없었던 문헌을 테스트할 때도 새로운 생물의학적 가설을 생성하고 검증할 수 있는가?
- RQ2불확실성 탐색을 통한 다중 에이전트 협업은 제로샷 가설 생성 성능을 어떻게 향상시키는가?
- RQ3팔문샷 학습이나 도구 사용을 통한 외부 지식 통합이 가설 품질에 얼마나 기여하는가?
- RQ4LLM 기반 메트릭이 인간 평가의 가설 품질 평가와 얼마나 잘 상관되는가?
- RQ5LLM 기반 생물의학적 가설 생성의 성능과 신뢰성에 영향을 미치는 주요 요인은 무엇인가?
주요 결과
- LLMs는 훈련 기간 동안 볼 수 없었던 문헌을 테스트할 때도 새로운 가설을 생성하고 검증할 수 있으며, 강력한 제로샷 능력을 보여준다.
- 도구 사용이 포함된 다중 에이전트 협업은 가설의 다양성을 증가시키고 제로샷 성능을 향상시키며, 불확실성 탐색의 가치를 입증한다.
- 제안된 네 가지 메트릭(신규성, 관련성, 중요도, 검증 가능성)은 GPT-4 평가와 인간 평가 간에 강한 상관관계를 보이며, 자동 평가에의 활용 가능성을 검증한다.
- 65B LLaMA 모델을 미세조정하면 제로샷 및 팔문샷 설정보다 향상된 가설 생성 성능을 기록한다.
- 팔문샷 학습이나 도구를 통한 외부 지식 통합이 항상 성능 향상으로 이어지는 것은 아니며, 지식의 유형과 범위를 신중히 선택해야 함을 시사한다.
- 다중 에이전트 프레임워크는 반복적 가설 정밀화와 협업 분석을 가능하게 하여 실제 과학적 발견 과정을 시뮬레이션한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.