[논문 리뷰] Classifying Cancer Stage with Open-Source Clinical Large Language Models
이 논문은 오픈 소스 임상 LLM이 라벨링된 학습 데이터 없이 비구조화된 병리 보고서에서 병리학 TNM 암 스테이지를 추출할 수 있으며, prompting 전략을 사용해 T, N, M 범주에서 미세 조정 벤치마크와 경쟁력 있는 성능을 달성한다.
Cancer stage classification is important for making treatment and care management plans for oncology patients. Information on staging is often included in unstructured form in clinical, pathology, radiology and other free-text reports in the electronic health record system, requiring extensive work to parse and obtain. To facilitate the extraction of this information, previous NLP approaches rely on labeled training datasets, which are labor-intensive to prepare. In this study, we demonstrate that without any labeled training data, open-source clinical large language models (LLMs) can extract pathologic tumor-node-metastasis (pTNM) staging information from real-world pathology reports. Our experiments compare LLMs and a BERT-based model fine-tuned using the labeled data. Our findings suggest that while LLMs still exhibit subpar performance in Tumor (T) classification, with the appropriate adoption of prompting strategies, they can achieve comparable performance on Metastasis (M) classification and improved performance on Node (N) classification.
연구 동기 및 목표
- 비구조화된 병리 보고서에서 암 TNM 스테이징의 자동 추출을 촉진한다.
- 라벨링된 학습 데이터 없이 오픈 소스 임상 LLM의 pTNM 분류를 평가한다.
- LLM 프롬프트 전략을 비교하고 벤치마크 성능을 미세 조정 모델과 대조한다.
- TCGA 병리 보고서 내 다양한 암 유형 및 T, N, M 범주에서 강건성을 평가한다.
제안 방법
- Ground truth가 있는 n=6,940개의 TCGA 병리 보고서를 사용하여 미세 조정 없이 TNM 분류를 평가한다.
- 세 가지 오픈 소스 LLM(Llama-2-70b-chat, ClinicalCamel-70B, Med42-70B)을 미세 조정된 Clinical-BigBird 벤치마크와 비교한다.
- 세 가지 프롬프트 전략 적용: Zero-shot, Zero-shot Chain-of-Thoughts (ZS-COT), 및 Few-shots.
- 모델 출력 후 정규 표현식 패턴으로 TNM 라벨 추출(T: T1–T4, N: N0–N3, M: M0–M1).
- 매크로 정밀도, 재현율, F1로 성능 평가하고 부트스트래핑(B=500)으로 95% 신뢰구간을 계산한다.
실험 결과
연구 질문
- RQ1오픈 소스 임상 LLM이 라벨링된 학습 데이터 없이 실제 병리 보고서에서 pTNM 스테이징을 추출할 수 있는가?
- RQ2다른 프롬프트 전략이 T, N, M 범주의 TNM 분류 성능에 어떤 영향을 미치는가?
- RQ3오픈 소스 임상 LLM이 pTNM 추출에서 미세 조정된 Clinical-BigBird 벤치마크와 어떻게 비교되는가?
- RQ4암 유형(예: BRCA, LUAD)이나 TNM 범주에 따라 성능이 달라지는가?
- RQ5현실 세계의 이질적인 보고서에서 임상 스테이징을 위해 오픈 소스 LLM을 배포하는 강점과 한계는 무엇인가?
주요 결과
- 오픈 소스 LLM이 병리 보고서에서 pTNM 스테이징을 학습 데이터 없이 추출할 수 있다.
- ClinicalCamel-70B 및 Med42-70B는 zero-shot 프롬프트에서 Llama-2-70b-chat보다 우수하며, N 및 M 범주에서 Clinical-BigBird와 동등하거나 더 나은 매크로 F1을 달성한다.
- 제로샷 체인-오브-생각(ZS-COT) 프롬팅은 여러 모델에서 T, N, M에 걸쳐 매크로 F1을 향상시킨다.
- Few-shot 프롬핑은 일반적으로 매크로 F1을 개선하지 못하고 기관 간 데이터세트 변동성으로 인해 성능이 저하될 수 있다.
- Med42-70B는 ZS-COT 또는 FS로 N 및 M 범주에서 강한 성능을 보이며 일부 암 유형 분석에서 Clinical-BigBird를 능가할 수 있다.
- M1(원격 전이) 클래스는 여전히 모델 전반에서 가장 도전적인 클래스로, 희귀 클래스에서 일관되게 낮은 매크로 F1을 보인다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.