Skip to main content
QUICK REVIEW

[논문 리뷰] Local Large Language Models for Complex Structured Medical Tasks

Cody Bumgardner, Aaron Mullen|arXiv (Cornell University)|2023. 08. 03.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 의료 병리 보고서에서 구조화된 질환 코드를 추출하기 위해 현장에 설치된 대규모 언어 모델(Large Language Models, LLMs)을 훈련시키는 방법을 제안한다. 결과적으로 LLaMA 기반 모델이 BERT 스타일 모델보다 다중 레이블, 복잡한 구조화된 작업에서 유의미하게 뛰어난 성능을 보이며, 정밀도가 낮아도 성능이 뛰어나다. 이 방법은 접근 가능한 하드웨어를 사용하여 고정밀도, 개인정보 보호에 적합한 현장 배포를 가능하게 한다.

ABSTRACT

This paper introduces an approach that combines the language reasoning capabilities of large language models (LLMs) with the benefits of local training to tackle complex, domain-specific tasks. Specifically, the authors demonstrate their approach by extracting structured condition codes from pathology reports. The proposed approach utilizes local LLMs, which can be fine-tuned to respond to specific generative instructions and provide structured outputs. The authors collected a dataset of over 150k uncurated surgical pathology reports, containing gross descriptions, final diagnoses, and condition codes. They trained different model architectures, including LLaMA, BERT and LongFormer and evaluated their performance. The results show that the LLaMA-based models significantly outperform BERT-style models across all evaluated metrics, even with extremely reduced precision. The LLaMA models performed especially well with large datasets, demonstrating their ability to handle complex, multi-label tasks. Overall, this work presents an effective approach for utilizing LLMs to perform domain-specific tasks using accessible hardware, with potential applications in the medical domain, where complex data extraction and classification are required.

연구 동기 및 목표

  • 제3자 API에 의존하지 않고 도메인 특화된, 구조화된 출력 생성이 가능한 현장 LLM 기반 접근법을 개발하는 것.
  • 현장 LLMs(예: LLaMA)와 BERT 스타일 모델 간의 성능을 비교하여, 정제되지 않은 외과 병리 보고서에서 구조화된 질환 코드를 추출하는 데에 사용하는 것.
  • 분류 성능에 영향을 주는 데이터셋 크기, 모델 아키텍처, 파라미터 수에 대한 영향을 평가하는 것.
  • 현장 LLMs가 표준 CPU/GPU 하드웨어를 사용하여 복잡한 실생활 의료 데이터에서 높은 정확도를 달성할 수 있음을 입증하여 클라우드 기반 모델의 개인정보 및 규제 위험을 피할 수 있음을 보여주는 것.

제안 방법

  • 구성 요소로 거대한 기술적 기술, 최종 진단, 질환 코드를 포함한 150만 건 이상의 정제되지 않은 외과 병리 보고서 데이터셋을 기반으로 LLaMA, BERT, LongFormer, BioClinicalBERT 모델을 미세조정하였다.
  • 모델이 특정 생성 지시에 따라 구조화된 출력을 생성하도록 유도하기 위해 지시 훈련(Instruction Tuning)을 사용하였다.
  • 확장성과 데이터 복잡성 영향을 평가하기 위해 세 가지 데이터셋 크기(tiny, small, large)로 훈련하였다.
  • 모든 모델과 데이터셋 크기에서 F1 점수를 사용하여 성능을 평가하였으며, 특히 질환 코드의 다중 레이블 분류에 중점을 두었다.
  • 프롬프트 엔지니어링과 입력 컨텍스트 정렬을 통해 모델가 의료 코드 규칙과 용어 체계에 더 잘 부합하도록 하였다.
  • 표준 하드웨어에서 모델를 배포하여 고성능 GPU가 필요 없이도 실행 가능함을 입증하였다.

실험 결과

연구 질문

  • RQ1의료 텍스트에서 훈련된 현장 LLMs가 비정형 병리 보고서에서 구조화된 질환 코드를 추출하는 데 BERT 스타일 모델보다 뛰어난 성능을 보일 수 있는가?
  • RQ2데이터셋 크기가 복잡한 다중 레이블 의료 코드 작업에서 현장 LLMs와 작은 NLP 모델 간의 성능에 어떤 영향을 미치는가?
  • RQ3도메인 특화된 고복잡도 의료 데이터에 대해 미세조정된 경우, 모델 아키텍처(예: LLaMA 대비 BERT)가 성능에 어느 정도 영향을 미치는가?
  • RQ4클라우드 기반 LLM 서비스에 의존하지 않고도 현장 LLMs가 높은 정확도를 달성하여 개인정보 보호 및 규정 준수를 보장할 수 있는가?

주요 결과

  • LLaMA 기반 모델은 가장 큰 데이터셋에서 F1 점수 0.785를 기록하여, 모든 데이터셋 크기에서 0.02 이하로 낮은 점수를 기록한 BERT 스타일 모델보다 유의미하게 뛰어난 성능을 보였다.
  • LLaMA 13b 모델은 대규모 데이터셋에서 F1 점수 0.785를 기록했고, 최고의 BERT 모델인 UKPathBERT는 단지 0.018에 그쳐 상당한 성능 격차가 있음을 확인하였다.
  • BERT와 Longformer 모델의 성능은 가장 작은 데이터셋에서 최고로 나타나며 데이터 복잡도 증가에 따라 감소하는 경향을 보였지만, LLaMA 모델은 더 큰 데이터셋에서 성능이 향상되어 우수한 확장성을 보였다.
  • 입력 기술 기술 길이와 예측 정확도 사이에 유의미한 상관관계가 발견되지 않아, 모델의 복잡성과 추론 능력이 입력 길이의 영향을 압도함을 시사하였다.
  • 빈도가 높은 질환 코드는 더 정확하게 예측되었지만, LLaMA 모델은 희귀 코드에 대해서도 강력한 성능 유지를 보였고, BERT 모델은 저빈도 레이블에 대해 어려움을 겪었다.
  • LLaMA 7b 모델은 표준 CPU/GPU 하드웨어에서 대규모 데이터셋에서 F1 = 0.783의 높은 성능을 기록하여 전용 인프라 없이도 현장 배포가 가능함을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.