Skip to main content
QUICK REVIEW

[논문 리뷰] PromptCBLUE: A Chinese Prompt Tuning Benchmark for the Medical Domain

Wei Zhu, Xiaoling Wang|arXiv (Cornell University)|2023. 10. 22.
Topic Modeling인용 수 4
한 줄 요약

PromptCBLUE는 중국어 의료 NLP를 위한 최초의 프롬프트 튜닝 벤치마크를 소개하며, CBLUE 벤치마크를 재구성하여 의료 엔티티 인식, 텍스트 분류, 자연어 추론, 대화 이해 및 생성 등 다양한 의료 NLP 작업을 통해 중국어 LLM의 다중 작업 능력을 평가한다. 이는 프롬프트 튜닝 기반으로 개발된 오픈소스 LLM이 일부 작업에서 GPT-4조차도 능가할 수 있음을 보여주며, 체인 오브 씽킹 프롬프팅 및 구조화된 출력 설계가 성능 향상에 크게 기여함을 입증한다.

ABSTRACT

Biomedical language understanding benchmarks are the driving forces for artificial intelligence applications with large language model (LLM) back-ends. However, most current benchmarks: (a) are limited to English which makes it challenging to replicate many of the successes in English for other languages, or (b) focus on knowledge probing of LLMs and neglect to evaluate how LLMs apply these knowledge to perform on a wide range of bio-medical tasks, or (c) have become a publicly available corpus and are leaked to LLMs during pre-training. To facilitate the research in medical LLMs, we re-build the Chinese Biomedical Language Understanding Evaluation (CBLUE) benchmark into a large scale prompt-tuning benchmark, PromptCBLUE. Our benchmark is a suitable test-bed and an online platform for evaluating Chinese LLMs' multi-task capabilities on a wide range bio-medical tasks including medical entity recognition, medical text classification, medical natural language inference, medical dialogue understanding and medical content/dialogue generation. To establish evaluation on these tasks, we have experimented and report the results with the current 9 Chinese LLMs fine-tuned with differtent fine-tuning techniques.

연구 동기 및 목표

  • 중국어 의료 LLM을 위한 고품질이며 유출되지 않은 다중 작업 벤치마크의 부족을 해결하기 위해.
  • 기존의 영어 전용, 지식 탐사에 집중하거나 사전 학습 데이터에 오염된 벤치마크의 한계를 극복하기 위해.
  • 프롬프트 튜닝을 활용한 표준화된 온라인 평가 플랫폼을 구축하기 위해.
  • 최신 중국어 LLM 및 파인튜닝 기법을 활용해 다양한 의료 NLP 작업에서 종합적인 기준 평가를 제공하기 위해.

제안 방법

  • CBLUE 벤치마크를 5개의 의료 NLP 작업(총 82,600개 샘플)을 포함하는 프롬프트 튜닝 중심의 데이터셋으로 재구성하였다.
  • 시험 세트 레이블을 비공개 및 비공개 상태로 유지하여 데이터 泄露를 방지하고 일반화 평가를 보장하였다.
  • 실시간 모델 평가를 지원하는 랭킹리스트 기능을 갖춘 온라인 플랫폼에 벤치마크를 호스팅하였다.
  • P-tuning, P-tuning-v2, Adapter, LoRA, AdaLoRA의 다섯 가지 프롬프트 튜닝 기법을 일관된 초모수 설정으로 적용하였다.
  • 모든 방법에 동일한 훈련 설정을 적용: 배치 크기 64, 초기 학습률 3e-4, 가중치 감쇠 1e-4, AdamW 옵timizer, 선형 감쇠 스케줄.
  • 최저 검증 손실 이후 200스텝 후의 모델 체크포인트를 선택하여 추론 품질을 향상시켰다.
Figure 1: The confusion matrix of the LLM on the KUAKE-QIC test set.
Figure 1: The confusion matrix of the LLM on the KUAKE-QIC test set.

실험 결과

연구 질문

  • RQ1프롬프트 튜닝은 다양한 생물의학 NLP 작업에서 중국어 의료 LLM의 다중 작업 능력을 효과적으로 평가할 수 있는가?
  • RQ2파인튜닝된 오픈소스 LLM은 중국어 의료 추론 및 추출 작업에서 GPT-4와 같은 전용 모델에 비해 어떻게 비교되는가?
  • RQ3체인 오브 씽킹 프롬프팅 및 구조화된 출력 형식은 의료 정보 추출 작업에서 성능 향상에 얼마나 기여하는가?
  • RQ4현재의 소수 샘플 프롬프트 튜닝 환경에서 의료 도메인 데이터에 대한 추가 사전 학습이 LLM 성능 향상에 뚜렷한 기여를 하는가?
  • RQ5LLM은 의료 대화 및 추론 작업에서 어떤 실패 패턴을 보이며, 이를 어떻게 완화할 수 있는가?

주요 결과

  • 파인튜닝된 오픈소스 LLM이 PromptCBLUE 벤치마크의 여러 작업에서 ChatGPT 및 GPT-4를 모두 앞서는 성능을 보였으며, 이는 모델 규모가 증가하더라도 파인튜닝이 여전히 필수적임을 시사한다.
  • 체인 오브 씽킹 프롬프팅 및 명시적 출력 형식 설계가 의료 엔티티 인식 및 정보 추출 작업에서 성능 향상에 뚜렷한 기여를 하였다.
  • 의료 도메인 데이터에 대한 추가 사전 학습이 일관된 성능 향상을 이끌지 못했으며, 이는 BERT 시대의 연구 결과와 대조된다.
  • 최고 성능을 낸 모델은 전체 PromptCBLUE 벤치마크에서 테스트 F1 스코어 71.10을 기록했으며, 작업별 스코어는 MedDG의 27.71에서 S-V2-MRG의 105.08까지 다양했다.
  • 사례 연구를 통해 LLM이 복잡한 추론 및 대화 일관성에서 실패하는 경우가 자주 발생하며, 특히 충돌하는 증상을 포함한 다턴 의료 상담에서 두드러진다.
  • 벤치마크는 코드와 온라인 평가 플랫폼과 함께 공개되어 향후 연구 및 커뮤니티 기여를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.