Skip to main content
QUICK REVIEW

[논문 리뷰] Interpretable Medical Diagnostics with Structured Data Extraction by Large Language Models

Aleksa Bisercic, Mladen Nikolić|arXiv (Cornell University)|2023. 06. 08.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 도메인 전문 지식 기반 추론 지침과 검증 및 수정을 위한 피드백 루프를 활용하여 비구조화된 의료 보고서에서 구조화된 표 형태 데이터를 추출하는 데에 대규모 언어 모델(Large Language Models, LLMs)을 활용하는 새로운 방법인 TEMED-LLM을 제안한다. 이 방법은 상태의 기준(SOTA) 텍스트 분류기들보다 뛰어난 진단 성능를 달성하면서도 의사결정 트리 및 로지스틱 회귀와 같은 표 형태의 머신러닝 모델을 통해 해석 가능한 예측을 가능하게 한다.

ABSTRACT

Tabular data is often hidden in text, particularly in medical diagnostic reports. Traditional machine learning (ML) models designed to work with tabular data, cannot effectively process information in such form. On the other hand, large language models (LLMs) which excel at textual tasks, are probably not the best tool for modeling tabular data. Therefore, we propose a novel, simple, and effective methodology for extracting structured tabular data from textual medical reports, called TEMED-LLM. Drawing upon the reasoning capabilities of LLMs, TEMED-LLM goes beyond traditional extraction techniques, accurately inferring tabular features, even when their names are not explicitly mentioned in the text. This is achieved by combining domain-specific reasoning guidelines with a proposed data validation and reasoning correction feedback loop. By applying interpretable ML models such as decision trees and logistic regression over the extracted and validated data, we obtain end-to-end interpretable predictions. We demonstrate that our approach significantly outperforms state-of-the-art text classification models in medical diagnostics. Given its predictive performance, simplicity, and interpretability, TEMED-LLM underscores the potential of leveraging LLMs to improve the performance and trustworthiness of ML models in medical applications.

연구 동기 및 목표

  • 비구조화된 임상 기록 및 진단 요약을 포함한 비구조화된 의료 보고서에서 구조화된 표 형태 특징을 추출하는 데 도전하는 것.
  • 의료 언어의 모호성, 맥락 의존성, 전문 용어의 풍부함을 다루는 데 있어 전통적인 텍스트 기반 머신러닝 모델의 한계를 극복하는 것.
  • LLM 추론과 데이터 검증을 조합하여 추출 정확도와 신뢰성을 향상시키는 방법을 개발하는 것.
  • LLM이 추출한 데이터에 해석 가능한 표 형태 모델을 적용하여 종단 간 해석 가능한 의료 진단을 가능하게 하는 것.
  • LLM 기반 데이터 추출이 의료 진단 과제에서 상태의 기준(SOTA) 텍스트 분류 모델보다 뛰어나다는 것을 입증하는 것.

제안 방법

  • TEMED-LLM은 사전 정의된 특징 스키마를 기반으로 텍스트 기반 의료 보고서에서 표 형태 특징을 추출하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 사용한다.
  • LLM이 특징 이름이 명시적으로 언급되지 않은 경우에도 특징을 추론할 수 있도록 도메인 전문 지식 기반 추론 지침을 통합한다.
  • 추출 품질 향상과 일관성 없는 사례 탐지에 기여하기 위해 새로운 데이터 검증 및 추론 보정 피드백 루프를 도입한다.
  • 추출된 표 형태 데이터는 의사결정 트리 및 로지스틱 회귀와 같은 해석 가능한 기계학습 모델을 통해 처리되어 인간이 이해할 수 있는 예측을 제공한다.
  • 고성능과 해석 가능성의 균형을 확보하기 위해 LLM을 활용한 구조화된 데이터 추출과 기존 표 형태 머신러닝 모델을 통합한 파이프라인을 구축한다.
  • 텍스트 분류기 및 표 형태 모델의 하이퍼파라미터는 그리드 서치를 통해 최적화되었으며, 표준 자연어 처리 및 머신러닝 라이브러리를 사용해 모델을 훈련시켰다.

실험 결과

연구 질문

  • RQ1LLM은 특징 이름이 명시적으로 기재되지 않은 비구조화된 의료 보고서에서 구조화된 표 형태 특징을 효과적으로 추출할 수 있는가?
  • RQ2추론 지침과 피드백 루프의 통합이 임상 텍스트에서 표 형태 데이터 추출의 정확도와 신뢰성에 뚜렷한 향상을 이끌어내는가?
  • RQ3LLM 기반 추출의 성능는 의료 진단 과제에서 상태의 기준(SOTA) 텍스트 분류 모델과 비교해 어떻게 나타나는가?
  • RQ4LLM이 추출한 데이터에 해석 가능한 표 형태 모델을 적용할 경우, 모델의 투명성과 임상적 신뢰성은 어느 정도 향상되는가?
  • RQ5제안된 방법론은 다양한 의료 진단 과제와 실제 전자 의료 기록 환경에서도 일반화 가능한가?

주요 결과

  • TEMED-LLM은 BioBERT, RoBERTa, XLM-RoBERTa와 같은 상태의 기준(SOTA) 텍스트 분류 모델들을 여러 의료 진단 과제에서 뛰어나게 능가한다.
  • 도메인 전문 지식 기반 추론 지침과 검증 및 보정 피드백 루프의 사용은 추출 품질 향상에 기여하여 특징 이름이 명시되지 않은 경우에도 정확한 표 형태 특징 추론이 가능하게 하였다.
  • LLM이 추출한 데이터에 기반한 의사결정 트리 모델은 참값 표 형태 데이터에 기반한 모델과 유사한 성능을 달성하였으며, 그림 3에서 이를 확인할 수 있었다. 이는 추출 과정의 높은 정밀도를 보여준다.
  • 추출된 데이터에 적용된 로지스틱 회귀 및 XGBoost 모델은 명확한 특징 기여도를 제공하여 임상적 신뢰성과 모델 투명성을 향상시켰다.
  • 공개 데이터셋과 임상의사로부터 수집한 실제 전자 의료 기록 모두에서 뛰어난 성능를 보여, 본 방법의 실용적 적용 가능성을 확인하였다.
  • LLM 기반 추출과 해석 가능한 표 형태 모델링을 통합한 종단 간 파이프라인은 고성능 예측 성능를 유지하면서도 모델의 해석 가능성을 확보하여 블랙박스 NLP 모델 대비 핵심적인 이점을 확보하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.