Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models are Few-Shot Clinical Information Extractors

Monica Agrawal, Stefan Hegselmann|arXiv (Cornell University)|2022. 05. 25.
Topic Modeling인용 수 48
한 줄 요약

논문은 GPT-3 스타일의 대형 언어 모델이 가이드 프롬프트와 가벼운 해석기를 사용하여 다양한 구조화된 출력 작업에서 제로샷 및 몇 샷 임상 정보 추출을 수행할 수 있음을 보여주고, 약한 감독을 통해 더 작은 모델의 학습을 시연합니다.

ABSTRACT

A long-running goal of the clinical NLP community is the extraction of important variables trapped in clinical notes. However, roadblocks have included dataset shift from the general domain and a lack of public clinical corpora and annotations. In this work, we show that large language models, such as InstructGPT, perform well at zero- and few-shot information extraction from clinical text despite not being trained specifically for the clinical domain. Whereas text classification and generation performance have already been studied extensively in such models, here we additionally demonstrate how to leverage them to tackle a diverse set of NLP tasks which require more structured outputs, including span identification, token-level sequence classification, and relation extraction. Further, due to the dearth of available data to evaluate these systems, we introduce new datasets for benchmarking few-shot clinical information extraction based on a manual re-annotation of the CASI dataset for new tasks. On the clinical extraction tasks we studied, the GPT-3 systems significantly outperform existing zero- and few-shot baselines.

연구 동기 및 목표

  • 대규모 언어 모델(LLMs)이 도메인 특화 학습 없이 제로샷 및 몇 샷 임상 정보 추출을 수행할 수 있음을 입증합니다.
  • CASI에서 파생된 임상 IE 작업을 위한 새로운 주석 데이터 세트를 도입합니다.
  • 가이드 프롬프트와 가벼운 해석기가 구조화된 출력(스팬 식별, 토큰 단위 분류, 관계 추출)을 가능하게 하는 방법을 제시합니다.
  • 다양한 임상 IE 작업에서 제로샷, 몇 샷 및 감독 하의 벤치마크를 GPT-3 스타일 시스템과 비교합니다.
  • LLM 출력의 약한 감독이 더 작고 배포 가능한 모델을 학습시키는 방법을 제시합니다.

제안 방법

  • LLM 출력이 구조화된 형식으로 수렴되도록 일회 예시를 포함한 guided 프롬프트 템플릿을 설계합니다.
  • LLM 문자열 출력을 작업별 구조화된 라벨 공간으로 매핑하는 해석기 R을 정의합니다(예: 목록, 스팬, 관계).
  • CASI 조각을 재주석하여 다섯 가지 임상 IE 작업(의미, 증거 추출, 공지/지시, 약물 상태, 약물 속성)에 대한 새로운 데이터 세트를 주석합니다.
  • 제로샷 및 몇 샷 벤치마크와 함께 GPT-3 유사 시스템을 평가하고, 약한 감독으로 학습된 증류 모델과 비교합니다.
  • 작업 전반에 걸쳐 토큰 수준, 구절 수준, 엔드투엔드 관계 추출 형식을 비교합니다.

실험 결과

연구 질문

  • RQ1GPT-3 스타일의 LLM이 제로샷 또는 몇 샷 프롬프트로 다양한 임상 IE 작업에서 경쟁력 있는 성능을 달성할 수 있는가?
  • RQ2가이드 프롬프트와 해석기가 임상 IE에서 사후 처리 축소 및 구조화된 출력 개선에 기여하는가?
  • RQ3LLM 출력의 약한 감독이 더 작고 배포 가능한 임상 IE 모델을 학습시키는 데 얼마나 효과적인가?
  • RQ4임상 의미 구분, 증거 추출, 공지, 약물 추출에 대한 LLM 기반 접근 방식의 강점과 한계는 무엇인가?

주요 결과

  • GPT-3 + R(가이드 프롬프트와 함께) 가 CASI 및 MIMIC 역 대치에서 임상 의미 구분에 대해 제로샷 벤치마크를 능가합니다.
  • PubMedBERT로의 약한 감독은 CASI 성능을 더욱 높이고 MIMIC 데이터에 대한 경쟁력 있는 전달을 가능하게 합니다.
  • 생의학적 증거 추출의 경우, GPT-3 + R은 평가 구성에서 여러 감독 벤치마크보다 토큰 수준 F1 및 암호 식별 정확도가 높습니다.
  • GPT-3 + R(1샷)으로의 공지 해석은 비임상 롱-도큐먼트 벤치마크에 비해 경쟁력 있는 재현율/정밀도를 달성하고 특정 구성에서 이를 능가합니다.
  • 약물 추출 작업에서 1샷 GPT-3 + R은 토큰, 구절 및 관계 추출 프레임에서 ScispaCy 벤치마크보다 재현율 및 정밀도가 높습니다.
  • 작업 전반에 걸쳐 guided 프롬pts는 해석기의 복잡성을 줄이고(대개 코드 10줄 미만) 구조화된 출력을 개선합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.