Skip to main content
QUICK REVIEW

[논문 리뷰] PULSAR: Pre-training with Extracted Healthcare Terms for Summarising Patients' Problems and Data Augmentation with Black-box Large Language Models

Hao Li, Yuping Wu|arXiv (Cornell University)|2023. 06. 05.
Topic Modeling인용 수 5
한 줄 요약

PULSAR는 임상 진행 기록에서 환자 문제 목록의 개괄적 요약을 위한 도메인 특화 사전 훈련 목표와 데이터 증강 프레임워크를 제안한다. 마스크된 의료 용어 추출과 LLM 기반 합성 데이터를 결합함으로써, 추가적인 레이블이 없는 조건에서 BioNLP 2023 공동 과제에서 2위를 기록하며 개발 데이터에서 더 큰 모델보다 3.1점 향상된 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Medical progress notes play a crucial role in documenting a patient's hospital journey, including his or her condition, treatment plan, and any updates for healthcare providers. Automatic summarisation of a patient's problems in the form of a problem list can aid stakeholders in understanding a patient's condition, reducing workload and cognitive bias. BioNLP 2023 Shared Task 1A focuses on generating a list of diagnoses and problems from the provider's progress notes during hospitalisation. In this paper, we introduce our proposed approach to this task, which integrates two complementary components. One component employs large language models (LLMs) for data augmentation; the other is an abstractive summarisation LLM with a novel pre-training objective for generating the patients' problems summarised as a list. Our approach was ranked second among all submissions to the shared task. The performance of our model on the development and test datasets shows that our approach is more robust on unknown data, with an improvement of up to 3.1 points over the same size of the larger model.

연구 동기 및 목표

  • 임상 진행 기록에서 환자 문제 목록의 개괄적 요약을 향상시키기 위해 작업에 특화된 사전 훈련을 수행한다.
  • 큰 레이블 데이터셋에 대한 의존도를 줄이기 위해 블랙박스 LLM을 활용해 데이터 증강을 수행한다.
  • 임상 문제 목록 생성이라는 최종 작업과 일치하는 사전 훈련 목표를 개발한다.
  • 제한된 레이블 데이터에서 사전 훈련과 데이터 증강의 효과를 평가한다.
  • 추가 수동 레이블링된 학습 데이터를 사용하지 않고 BioNLP 2023 공동 과제 1A에서 높은 성능을 달성한다.

제안 방법

  • 세 가지 마스킹 정책인 간격 문장 생성, 마스킹 언어 모델링, 마스킹 의료 용어 예측을 사용하여 MIMIC-III 진행 기록에서 인코더-디코더 모델을 사전 훈련한다.
  • QuickUMLS와 i2b2-2010 트레이닝된 NER 모델을 사용해 임상 엔티티를 식별하고 감시 토큰으로 대체하여 마스킹을 수행한다.
  • 간격 문장 생성과 마스킹 언어 모델링을 결합한 이중 사전 훈련 목표를 적용해 요약 능력을 향상시킨다.
  • 블랙박스 LLM을 활용해 원본 입력과 동일, 약간 유사, 또는 완전히 다른 주제를 가진 세 가지 레이블 유형의 합성 데이터를 생성한다.
  • 실제 데이터와 증강 데이터를 모두 사용해 사전 훈련된 모델을 문제 목록 생성 작업에 피지컬 훈련한다.
  • 개발 및 테스트 세트에서 성능을 평가하기 위해 ROUGE 점수를 사용하며, 입력 변형으로 평가자만 포함된 경우와 평가자+주관적+객관적 항목을 포함한 경우를 고려한다.

실험 결과

연구 질문

  • RQ1임상 용어와 문장 범위를 마스킹하는 새로운 사전 훈련 목표가 환자 문제 목록의 개괄적 요약에 어떻게 기여하는가?
  • RQ2레이블이 제한된 조건에서 LLM 기반 데이터 증강이 모델 성능에 얼마나 기여하는가?
  • RQ3입력 길이(예: 평가자 대비 평가자+주관적+객관적 항목)가 문제 목록 생성 성능에 어떤 영향을 미치는가?
  • RQ4모델 크기가 증가함에 따라 데이터 증강의 성능 향상 효과가 감소하는가?
  • RQ5사전 훈련된 PULSAR 모델은 FlanT5 및 ClinicalT5와 같은 강력한 베이스라인 모델과 비교해 알려지지 않은 테스트 데이터에서 어떻게 성능을 내는가?

주요 결과

  • PULSAR는 개발 세트에서 FlanT5-11B 모델보다 3.1점 높은 ROUGE 점수를 기록했으며, 이는 전체 사전 훈련 에포크의 1회 미만으로 훈련된 상태에서도 성취된 성과이다.
  • 공식 테스트 세트에서 PULSAR는 ClinicalT5-large보다 11.2 ROUGE 점수 높은 성능을 보이며, 알려지지 않은 데이터에서 강력한 일반화 능력을 입증했다.
  • 데이터 증강은 모든 모델에서 평균 3점 향상된 성능을 기록했으며, 특히 ClinicalT5-large와 같은 작은 모델에서 가장 큰 향상(최대 6점)을 보였다.
  • 주관적 및 객관적 항목을 입력에 포함시켰을 경우 평가자 항목만 사용한 경우에 비해 개발 세트에서 7점 향상되었고, 테스트 세트에서는 2.9점 향상되었다.
  • 입력 길이가 512 토큰을 초과해도 성능 향상가 관찰되지 않아, 더 긴 컨텍스트에서는 수익 감소 또는 성능 저하가 발생할 수 있음을 시사한다.
  • PULSAR-3B와 PULSAR-11B 간 성능 격차가 미미한 것으로 나타나, 사전 훈련 목표가 제한된 데이터로도 작은 모델이 높은 성능을 달성하도록 도와주는 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.