[논문 리뷰] Benchmarking large language models for biomedical natural language processing applications and recommendations
이 연구는 BioNLP 벤치마크 12개에 걸쳐 네 가지 대형 언어 모델을 체계적으로 평가하고, 제로샷, 퓨샷, 및 미세 조정을 전통적인 BERT/BART 미세 조정과 비교하며 권고사항을 제시한다.
The rapid growth of biomedical literature poses challenges for manual knowledge curation and synthesis. Biomedical Natural Language Processing (BioNLP) automates the process. While Large Language Models (LLMs) have shown promise in general domains, their effectiveness in BioNLP tasks remains unclear due to limited benchmarks and practical guidelines. We perform a systematic evaluation of four LLMs, GPT and LLaMA representatives on 12 BioNLP benchmarks across six applications. We compare their zero-shot, few-shot, and fine-tuning performance with traditional fine-tuning of BERT or BART models. We examine inconsistencies, missing information, hallucinations, and perform cost analysis. Here we show that traditional fine-tuning outperforms zero or few shot LLMs in most tasks. However, closed-source LLMs like GPT-4 excel in reasoning-related tasks such as medical question answering. Open source LLMs still require fine-tuning to close performance gaps. We find issues like missing information and hallucinations in LLM outputs. These results offer practical insights for applying LLMs in BioNLP.
연구 동기 및 목표
- LLMs가 전통적인 모델에 비해 BioNLP 작업에서 얼마나 성능을 나타내는지 다룬다.
- 생의학 맥락에서 LLM의 제로샷, 퓨샷, 및 미세 조정 능력을 평가한다.
- LLM 출력에서 불일치, 누락 정보, 환각을 식별한다.
- BioNLP 응용에서 LLM 사용의 비용 함의를 평가한다.
- BioNLP에서 LLM을 적용하기 위한 실용적 권고안을 제공한다.
제안 방법
- 12개의 BioNLP 벤치마크를 6개 응용 분야에 걸쳐 4개의 LLM(GPT 및 LLaMA 계열)을 체계적으로 평가한다.
- LLMs의 제로샷, 퓨샷, 및 미세 조정 성능을 전통적인 BERT 또는 BART 모델의 미세 조정과 비교한다.
- 일관성, 누락 정보, 환각에 대한 출력 품질을 분석한다.
- BioNLP 작업에서 LLM 사용의 비용 분석을 수행한다.
실험 결과
연구 질문
- RQ1제로샷, 퓨샷 및 미세 조정 설정에서 LLM이 BioNLP 벤치마크에서 전통적인 BERT/BART 미세 조정과 비교하여 어떻게 성능을 보이는가?
- RQ2의료 질의 응답과 같은 추론 관련 BioNLP 작업에서 폐쇄형 소스 LLM(GPT-4 등)이 더 나은가?
- RQ3오픈 소스 LLM이 전통적인 모델과의 성능 격차를 줄이기 위해 미세 조정이 어느 정도 필요한가?
- RQ4BioNLP 작업에서 LLM 출력의 일반적인 문제(누락 정보, 환각)는 무엇인가?
- RQ5이 벤치마크 연구에서 BioNLP에 LLM을 적용하기 위한 실용적인 가이드라인은 무엇인가?
주요 결과
- 전통적인 미세 조정은 대부분의 BioNLP 작업에서 제로샷 또는 퓨샷 LLM보다 일반적으로 더 우수하다.
- GPT-4와 같은 폐쇄형 LLM은 의료 질의 응답과 같은 추론 관련 작업에서 뛰어나다.
- 오픈 소스 LLM은 여전히 전통적인 모델과의 성능 격차를 줄이기 위해 미세 조정이 필요하다.
- LLM 출력은 누락 정보와 환각을 나타내며 BioNLP의 신뢰성에 영향을 준다.
- 본 연구는 BioNLP에서 LLM을 적용하기 위한 실용적 통찰과 권고를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.