Skip to main content
QUICK REVIEW

[논문 리뷰] MedDM:LLM-executable clinical guidance tree for clinical decision-making

Binbin Li, Tianxin Meng|arXiv (Cornell University)|2023. 12. 05.
Biomedical Text Mining and Ontologies인용 수 7
한 줄 요약

이 논문은 임상 실무 지침에서 유래한 대규모 의료 진단 의사결정 데이터셋인 MedDM을 소개하고, 전문화된 다회화 임상 의사결정을 위한 대규모 언어모델(LLM)의 성능을 햖थ기 위해 LLM 실행 가능한 임상 지침 트리(CGT)를 제안한다. 5,000개의 의료 문헌 자료에서 유래한 플로우차트를 구조화되고 자연어 기반의 의사결정 트리로 변환함으로써, LLM이 반복적인 환자 대화를 통해 차등 진단을 수행할 수 있도록 하여, 표준 의료 Q&A 모델에 비해 진단 정확도와 임상적 추론 능력을 크게 향상시킨다.

ABSTRACT

It is becoming increasingly emphasis on the importance of LLM participating in clinical diagnosis decision-making. However, the low specialization refers to that current medical LLMs can not provide specific medical advice, which are more like a medical Q\&A. And there is no suitable clinical guidance tree data set that can be used directly with LLM. To address this issue, we first propose LLM-executavle clinical guidance tree(CGT), which can be directly used by large language models, and construct medical diagnostic decision-making dataset (MedDM), from flowcharts in clinical practice guidelines. We propose an approach to screen flowcharts from medical literature, followed by their identification and conversion into standardized diagnostic decision trees. Constructed a knowledge base with 1202 decision trees, which came from 5000 medical literature and covered 12 hospital departments, including internal medicine, surgery, psychiatry, and over 500 diseases.Moreover, we propose a method for reasoning on LLM-executable CGT and a Patient-LLM multi-turn dialogue framework.

연구 동기 및 목표

  • 현재 의료 LLM의 전문화도가 낮아, 진단을 단순한 Q&A로 간주하는 문제를 해결하기 위해.
  • 실제 임상 실무 지침에서 유래한 공개 가능한 고품질 의료 진단 의사결정 데이터셋(MedDM)을 구축하기 위해.
  • 차등 진단 논리를 자연어 기반으로 코딩하여 직접 LLM 추론이 가능한 새로운 LLM 실행 가능한 임상 지침 트리(CGT) 표현 방식을 설계하기 위해.
  • 의사처럼 추론하는 것을 모방할 수 있도록, 반복적인 증상 수집과 지침에 부합하는 의사결정 경로를 기반으로 한 의사결정 검색 기반 대화 프레임워크를 개발하기 위해.
  • 다회화 환자-LLM 상호작용을 통해 정확하고 임상적으로 신뢰할 수 있는 응답을 생성하는 프레임워크의 효과성을 평가하기 위해.

제안 방법

  • 의료 문헌 자료 5,000건에서 1,202개의 임상 플로우차트를 레이아웃 분석과 이미지 전처리를 통해 플로우차트가 포함된 페이지를 분리하여 추출하였다.
  • 노드 검출을 위해 Faster R-CNN을 사용하고, 윤곽선 검출과 DBSCAN 군집화를 조합한 플로우차트 인식 모델을 개발하여 연결선과 의사결정 경로를 식별하였다. 이 모델은 노드 검출 정확도가 98%에 도달하였다.
  • 플로우차트 내 텍스트 인식을 위해 CnOCR를 적용하고, 7명의 의료 전문가가 참여한 팀이 노드 및 연결 관계의 수동 검증과 수정을 수행하였다.
  • 인식된 플로우차트를 자연어로 각 노드를 표현하고 의사결정 논리를 구조화된 기계판독 가능한 텍스트로 인코딩함으로써, LLM 실행 가능한 임상 지침 트리(CGT)로 변환하였다.
  • CGT 표현을 저장하기 위해 벡터 데이터베이스를 구현하고, 재작성된 환자 대화 임베딩와 CGT 벡터 간 코사인 유사도를 활용해 관련 의사결정 경로를 검색하였다.
  • LLM이 검색된 CGT 경로를 외부 지식으로 활용하여 추론을 이끌어내는 다회화 대화 시스템을 구축하였으며, 이는 후속 질문, 진단 또는 치료 계획을 포함한 응답을 생성하도록 하였다.

실험 결과

연구 질문

  • RQ1LLM이 자연어 기반의 구조화된 의료 진단 트리에 의해 효과적으로 이끌려 다회화 차등 진단 추론을 수행할 수 있을까? 단순한 증상 Q&A가 아니라.
  • RQ2임상 실무 지침에서 유래한 플로우차트를 체계적으로 추출하고, 표준화된 LLM 접근 가능한 형식으로 변환 및 검증할 수 있는 방법은 무엇인가?
  • RQ3LLM 실행 가능한 CGT를 활용한 검색 증강 생성 프레임워크는 LLM이 생성하는 의료 응답의 정확도와 임상적 신뢰성에 얼마나 기여하는가?
  • RQ4전문가가 검증한 지침 기반 의사결정 트리의 통합은 LLM 기반 환자 대화의 일관성과 추론 품질에 어떤 영향을 미치는가?
  • RQ5대규모 공개 데이터셋인 임상 의사결정 트리(MedDM)는 향후 LLM 기반 의료 진단 지원 시스템의 벤치마킹과 발전을 위한 기초 자원으로 기능할 수 있는가?

주요 결과

  • MedDM 데이터셋은 5,000개의 의료 문헌 자료에서 유래한 1,202개의 검증된 임상 지침 트리를 포함하며, 12개 병원 부서와 500여 가지 이상의 질환을 커버하고 있다.
  • Faster R-CNN를 활용한 플로우차트 인식 파이pline은 노드 검출 정확도 98%를 달성하여 의료 이미지에서 신뢰할 수 있는 구조적 추출이 가능함을 입증하였다.
  • LLM 실행 가능한 CGT 표현 방식은 자연어 기반으로 차등 진단 논리를 성공적으로 인코딩하여, 기호 논리로의 변환 없이도 LLM이 직접 추론할 수 있도록 하였다.
  • 의사결정 검색 기반 대화 프레임워크는 LLM이 의사처럼 질문 패턴을 모방할 수 있도록 하여, 환자 응답에 따라 동적으로 후속 질문을 선택할 수 있도록 하였다.
  • 표준 LLM에 비해 진단 추론 품질이 향상되었으며, 응답이 임상 지침 경로와 더 잘 일치하고, 일반적이거나 추측적인 답변의 비율이 감소하였다.
  • MedDM과 CGT 프레임워크를 공개함으로써, 향후 LLM 기반 의료 진단 지원 시스템의 벤치마킹과 발전을 위한 기초를 마련하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.