Skip to main content
QUICK REVIEW

[논문 리뷰] Domain-adapted large language models for classifying nuclear medicine reports

Zachary Huemann, Changhee Lee|arXiv (Cornell University)|2023. 03. 01.
Radiomics and Machine Learning in Medical ImagingMedicine인용 수 3
한 줄 요약

이 연구는 핵의학 영상 보고서에서 5점 Deauville 점수를 예측하기 위해 도메인 적응된 대규모 언어 모델을 평가한다. 특히 18F-FDG PET/CT 보고서에서 5점 Deauville 점수를 예측하기 위해 일반 목적 모델인 RoBERTa를 마스킹 언어 모델링을 통해 핵의학 전용 텍스트로 미세조정함으로써 도메인 적응을 수행하였다. 도메인 적응을 통해 다섯 클래스 정확도가 77.4%로 향상되었으며, 이는 인간 전문가(66%)를 뛰어넘고 시각 모델 및 다중모달 모델보다도 뛰어난 성능을 보였다.

ABSTRACT

With the growing use of transformer-based language models in medicine, it is unclear how well these models generalize to nuclear medicine which has domain-specific vocabulary and unique reporting styles. In this study, we evaluated the value of domain adaptation in nuclear medicine by adapting language models for the purpose of 5-point Deauville score prediction based on clinical 18F-fluorodeoxyglucose (FDG) PET/CT reports. We retrospectively retrieved 4542 text reports and 1664 images for FDG PET/CT lymphoma exams from 2008-2018 in our clinical imaging database. Deauville scores were removed from the reports and then the remaining text in the reports was used as the model input. Multiple general-purpose transformer language models were used to classify the reports into Deauville scores 1-5. We then adapted the models to the nuclear medicine domain using masked language modeling and assessed its impact on classification performance. The language models were compared against vision models, a multimodal vision language model, and a nuclear medicine physician with seven-fold Monte Carlo cross validation, reported are the mean and standard deviations. Domain adaption improved all language models. For example, BERT improved from 61.3% five-class accuracy to 65.7% following domain adaptation. The best performing model (domain-adapted RoBERTa) achieved a five-class accuracy of 77.4%, which was better than the physician's performance (66%), the best vision model's performance (48.1), and was similar to the multimodal model's performance (77.2). Domain adaptation improved the performance of large language models in interpreting nuclear medicine text reports.

연구 동기 및 목표

  • 도메인 적응이 대규모 언어 모델의 핵의학 보고서 해석 성능을 향상시키는지 평가하는 것.
  • 자유 텍스트 PET/CT 보고서 기반으로 림프종 반응 평가에 사용되는 Deauville 점수를 정확하게 예측할 수 있는 언어 모델의 능력을 평가하는 것.
  • 도메인 적응된 언어 모델의 성능을 시각 모델, 다중모달 모델 및 한 명의 핵의학 전문의와 비교하는 것.
  • 핵의학 텍스트에 특화된 사전학습이 일반 생물의학 또는 일반 목적 사전학습보다 더 효과적인지 확인하는 것.
  • 의사가 할당한 보고서와 점수 기반으로 이미지 정보가 텍스트 기반 분류에 추가적인 가치를 제공하는지 조사하는 것.

제안 방법

  • 2008~2018년 동안 단일 기관의 PACS 데이터베이스에서 4,542건의 FDG PET/CT 보고서와 1,664장의 영상 자료를 확보하였으며, 보고서 텍스트의 N-gram 분석을 통해 Deauville 점수를 추출하였다.
  • 언어 모델 훈련 및 추론을 위해 보고서에서 Deauville 점수를 은폐하여 마스킹된 입력 텍스트를 생성하였다.
  • 핵의학 전용 코퍼스를 대상으로 자기지도 학습 방식의 마스킹 언어 모델링을 통해 일반 목적 트랜스포머 모델(예: BERT, RoBERTa)을 적응시켰다.
  • 일곱 번의 몬테카를로 교차검증을 사용하여 다수의 언어 모델, 시각 모델(예: ResNet), 다중모달 시각-언어 모델을 훈련 및 평가하였다.
  • 주요 평가 지표로 다섯 클래스 정확도를 사용하였으며, 각 폴드 간 평균 ± 표준편차를 보고하였다.
  • 도메인 적응된 모델을 비도메인 적응된 버전, 시각 모델, 다중모달 모델 및 한 명의 핵의학 전문의와 비교하였다.

실험 결과

연구 질문

  • RQ1도메인 적응이 핵의학 보고서 분류를 위한 대규모 언어 모델의 성능을 향상시키는가?
  • RQ2도메인 적응된 언어 모델의 성능은 동일한 작업에서 시각 모델 및 다중모달 모델과 비교해 어떻게 다른가?
  • RQ3도메인 적응된 언어 모델은 텍스트 보고서 기반 Deauville 점수 예측에서 인간 전문가를 능가할 수 있는가?
  • RQ4핵의학 분야에 특화된 도메인 적응은 일반 생물의학 도메인 적응(BioClinicalBERT 등) 또는 일반 목적 사전학습(BERT 등)보다 더 효과적인가?
  • RQ5의사가 할당한 보고서와 점수 기반으로 PET/CT 스캔의 이미지 정보가 텍스트 기반 분류에 추가적인 이점을 제공하는가?

주요 결과

  • 도메인 적응은 테스트된 모든 언어 모델의 성능을 유의미하게 향상시켰으며, BERT의 다섯 클래스 정확도는 적응 후 61.3%에서 65.7%로 상승하였다.
  • 가장 높은 성능을 보인 모델인 도메인 적응 RoBERTa의 다섯 클래스 정확도는 77.4% ± 3.4%였으며, 인간 전문가의 정확도 66%를 뛰어넘었다.
  • 다중모달 모델의 정확도는 77.2% ± 3.2%로 유사하게 나타나, 예측 과정에서 언어 정보가 주도적인 역할을 했음을 시사한다.
  • 시각 전용 모델은 성능이 열악하여 최대 정확도 48.1% ± 3.5%에 머물렀으며, 이는 이미지 특징만으로는 이 작업에 충분하지 않음을 시사한다.
  • 핵의학 텍스트에 대해 미세조정된 더 작은 RadBERT 모델이 더 큰 RoBERTa 모델과 유사한 성능을 기록하여, 도메인 특화 사전학습의 가치를 입증하였다.
  • 일반 목적 및 생물의학 도메인 적응 언어 모델(BioClinicalBERT 등)은 도메인 적응 모델을 능가하지 못하였으며, 핵의학 분야에 특화된 적응이 필수적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.