[논문 리뷰] Evaluation of ChatGPT Family of Models for Biomedical Reasoning and Classification
연구는 생물의학 분류 및 추론 과제에서 ChatGPT 모델(GPT-3.5, GPT-4)을 10,000개가 넘는 대리 샘플로 평가하고, 미세조정 및 전통 모델이 종종 프롬프트를 사용하는 가장 큰 LLM을 능가하는 경향이 있음을 발견했습니다. BoW와 로지스틱 회귀가 복잡한 프롬프트 성능과 비슷하며, 프롬프트 엔지니어링은 상당한 노력이 필요합니다.
Recent advances in large language models (LLMs) have shown impressive ability in biomedical question-answering, but have not been adequately investigated for more specific biomedical applications. This study investigates the performance of LLMs such as the ChatGPT family of models (GPT-3.5s, GPT-4) in biomedical tasks beyond question-answering. Because no patient data can be passed to the OpenAI API public interface, we evaluated model performance with over 10000 samples as proxies for two fundamental tasks in the clinical domain - classification and reasoning. The first task is classifying whether statements of clinical and policy recommendations in scientific literature constitute health advice. The second task is causal relation detection from the biomedical literature. We compared LLMs with simpler models, such as bag-of-words (BoW) with logistic regression, and fine-tuned BioBERT models. Despite the excitement around viral ChatGPT, we found that fine-tuning for two fundamental NLP tasks remained the best strategy. The simple BoW model performed on par with the most complex LLM prompting. Prompt engineering required significant investment.
연구 동기 및 목표
- QA를 넘어 생물의학적 추론에 대한 ChatGPT 가족의 능력을 평가한다.
- 데이터 프라이버시 제약으로 인해 대리 샘플을 사용하여 두 가지 기본 임상 NLP 과제를 평가한다.
- 생물의학 과제에서 LLM 프롬프트와 전통 모델 및 미세조정 기반의 베이스라인을 비교한다.
- 생물의학 텍스트 과제에서 LLM을 배치하기 위한 모범 사례 가이던스를 제공한다.
제안 방법
- 임상 분류 및 인과 관계 과제를 위한 대리 샘플 10,000개 이상을 사용한다.
- 두 가지 과제: (1) 문헌에 제시된 진술이 건강 조언에 해당하는지 분류; (2) 생물의학 문헌에서 인과 관계를 탐지한다.
- ChatGPT 변형(GPT-3.5s, GPT-4)을 기준 모델(BoW with 로지스틱 회귀, 미세조정된 BioBERT)과 비교한다.
- 공개 OpenAI API에 환자 데이터를 전달하지 않고 평가를 위해 대리 데이터를 활용한다.
- LLM 성능에 미치는 프롬프트 엔지니어링의 영향을 평가한다.
실험 결과
연구 질문
- RQ1ChatGPT 모델이 과학 문헌에서 진술을 정확히 건강 조언으로 분류할 수 있는가?
- RQ2ChatGPT 모델이 생물의학 문헌에서 인과 관계를 탐지할 수 있는가?
- RQ3이러한 과제에서 ChatGPT 모델은 BoW 로지스틱 회귀 및 미세조정된 BioBERT와 어떻게 비교되는가?
- RQ4프롬프트 엔지니어링과 전통 모델 미세조정에 필요한 상대적 노력은 어느 정도인가?
주요 결과
- 미세조정은 두 NLP 과제에서 비교 대상 중 최상의 전략으로 남아 있다.
- BoW with 로지스틱 회귀는 가장 복잡한 LLM 프롬프트 전략과 동등한 성능을 보인다.
- 프롬프트 엔지니어링은 경쟁 가능한 성능에 도달하기 위한 상당한 투자를 필요로 한다.
- Task-specific 미세조정 없이도 ChatGPT 모델은 일반적으로 미세조정된 BioBERT 베이스라인보다 성능이 떨어진다.
- 전반적으로 고전적인 NLP 접근 방식은 이러한 생물의학 과제에서 프롬프트 기반 LLM 성능과 대등하거나 이를 초과할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.