Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of ChatGPT on Biomedical Tasks: A Zero-Shot Comparison with Fine-Tuned Generative Transformers

Israt Jahan, Md Tahmid Rahman Laskar|arXiv (Cornell University)|2023. 06. 07.
Topic Modeling인용 수 4
한 줄 요약

이 연구는 생물의학 NLP 작업—관계 추출, 질의 응답, 문서 분류, 요약—에 대해 ChatGPT의 제로샷 성능을 평가하며, BioGPT와 BioBART와 같은 미세조정된 모델들과 비교한다. 놀랍게도, 훈련 데이터셋이 작은 데이터셋에서 ChatGPT는 미세조정된 전문 모델들을 능가하며, 미세조정 없이도 자원이 부족한 생물의학적 환경에서 강력한 소수의 예제 일반화 성능을 보여준다.

ABSTRACT

ChatGPT is a large language model developed by OpenAI. Despite its impressive performance across various tasks, no prior work has investigated its capability in the biomedical domain yet. To this end, this paper aims to evaluate the performance of ChatGPT on various benchmark biomedical tasks, such as relation extraction, document classification, question answering, and summarization. To the best of our knowledge, this is the first work that conducts an extensive evaluation of ChatGPT in the biomedical domain. Interestingly, we find based on our evaluation that in biomedical datasets that have smaller training sets, zero-shot ChatGPT even outperforms the state-of-the-art fine-tuned generative transformer models, such as BioGPT and BioBART. This suggests that ChatGPT's pre-training on large text corpora makes it quite specialized even in the biomedical domain. Our findings demonstrate that ChatGPT has the potential to be a valuable tool for various tasks in the biomedical domain that lack large annotated data.

연구 동기 및 목표

  • 미세조정 없이 생물의학 NLP 벤치마크 작업에서 ChatGPT의 제로샷 성능을 평가하는 것.
  • BioGPT와 BioBART와 같은 최첨단 미세조정된 생성 모델들과의 ChatGPT 성능 비교.
  • 광범위한 코퍼스에서 사전 훈련된 대규모 언어 모델이 자원이 부족한 생물의학적 환경에서 효과적으로 일반화할 수 있는지 조사하는 것.
  • 약한 생물의학 데이터가 존재할 경우 제로샷 LLM이 실용적인 대안이 될 수 있는지 평가하는 것.
  • 모든 ChatGPT 생성 응답과 평가 코드를 공개하여 재현 가능성을 확보하는 것.

제안 방법

  • 제로샷 추론을 통해 프롬프트 엔지니어링을 활용해 ChatGPT가 생물의학 작업 네 가지—관계 추출, 질의 응답, 문서 분류, 요약—에 대해 지시하도록 유도하는 방법.
  • 각 작업에 맞게 정교하게 설계된 프롬프트를 사용하였으며, 필요에 따라 지시 템플릿과 소수의 예제를 포함하였다.
  • 표준 벤치마크 데이터셋—BC5CDR, KD-DTI, DDI, HoC, PubMedQA, iCliniq, HealthCare Magic, MeQSum, MEDIQA-QS, MEDIQA-MAS, MEDIQA-ANS—을 사용해 평가를 수행하였다.
  • 표준 평가 지표인 F1 점수, 정확도, 요약 작업에 대해서는 ROUGE 점수를 사용하여 성능을 측정하였다.
  • 직접 비교를 위해 동일한 평가 조건에서 미세조정된 모델(BioGPT, BioBART)을 베이스라인으로 사용하였다.
  • 모든 응답과 평가 코드를 공개하여 재현 가능성을 확보하고 향후 연구를 촉진하였다.

실험 결과

연구 질문

  • RQ1ChatGPT는 어떤 미세조정 없이도 제로샷 설정에서 생물의학 NLP 작업을 효과적으로 수행할 수 있는가?
  • RQ2ChatGPT의 제로샷 성능는 BioGPT와 BioBART와 같은 최첨단 미세조정된 생성 모델들과 비교해 어떻게 되는가?
  • RQ3ChatGPT의 성능는 다양한 생물의학 작업과 데이터셋 크기 간에 크게 달라지는가?
  • RQ4훈련 데이터셋이 작은 자원이 부족한 환경에서 제로샷 LLM이 미세조정된 모델을 능가할 수 있는가?
  • RQ5약한 생물의학 데이터가 존재할 경우, 사전 훈련된 LLM인 ChatGPT의 잠재적 활용 가능성은 무엇인가?

주요 결과

  • ChatGPT는 훈련 데이터셋이 작은 생물의학 데이터셋에서 BioGPT와 BioBART와 같은 미세조정된 모델들보다 뛰어난 성능을 보였다.
  • BC5CDR 데이터셋(훈련 샘플 500개)에서 ChatGPT는 화학물질-질병 관계 추출 작업에서 미세조정된 모델들을 능가했다.
  • HoC 문서 분류 작업에서 ChatGPT는 특별한 작업 맞춤형 미세조정 없이도 강력한 제로샷 정확도를 보였다.
  • PubMedQA 질의 응답 벤치마크에서 ChatGPT는 사실적 일관성이 높은 고품질의 답변을 생성하였다.
  • 대화 요약 작업(iCliniq 및 HealthCare Magic)에서 ChatGPT는 유의미하고 일관성 있는 요약문을 생성하였으며 경쟁적인 ROUGE 점수를 기록하였다.
  • 결과는 ChatGPT가 다양한 텍스트 코퍼스에서 사전 훈련을 통해 넓은 범위의 일반화 능력을 확보하고 있음을 시사하며, 이는 전문적인 생물의학적 맥락에서도 효과적인 도메인 내 일반화를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.