Skip to main content
QUICK REVIEW

[논문 리뷰] Deciphering Diagnoses: How Large Language Models Explanations Influence Clinical Decision Making

Dmitriy Umerenkov, Galina Zubkova|arXiv (Cornell University)|2023. 10. 03.
Machine Learning in HealthcareComputer Science인용 수 3
한 줄 요약

이 연구는 대규모 언어 모델(Large Language Models, LLMs)이 환자의 증상과 진단을 연결하는 설명을 어떻게 생성하는지 평가하며, LLM이 생성한 설명이 의료진의 진단에 대한 동의를 크게 증가시키지만, 5%에서 30%의 경우에 오류를 포함하고 있으며 주로 증상-진단 연결에 대한 과도한 해석 때문임을 발견한다. 연구는 LLM의 임상 의사결정 지원에서의 설득력 있는 영향력을 강조하면서도 사실 오류로 인한 위험도 제기한다.

ABSTRACT

Clinical Decision Support Systems (CDSS) utilize evidence-based knowledge and patient data to offer real-time recommendations, with Large Language Models (LLMs) emerging as a promising tool to generate plain-text explanations for medical decisions. This study explores the effectiveness and reliability of LLMs in generating explanations for diagnoses based on patient complaints. Three experienced doctors evaluated LLM-generated explanations of the connection between patient complaints and doctor and model-assigned diagnoses across several stages. Experimental results demonstrated that LLM explanations significantly increased doctors' agreement rates with given diagnoses and highlighted potential errors in LLM outputs, ranging from 5% to 30%. The study underscores the potential and challenges of LLMs in healthcare and emphasizes the need for careful integration and evaluation to ensure patient safety and optimal clinical utility.

연구 동기 및 목표

  • 의사들이 진단 가설을 평가하는 데 있어 LLM이 생성한 설명의 영향을 평가하기 위해.
  • 환자의 증상과 의료 진단을 연결하는 LLM 설명의 품질과 사실 정확도를 평가하기 위해.
  • LLM이 생성한 의료 설명에서 흔히 나타나는 오류 패턴을 특정하기 위해.
  • 설명이 경험이 풍부한 임상의사들 간의 진단 동의율에 어떤 영향을 미치는지 조사하기 위해.
  • 임상 의사결정 지원 시스템(Clinical Decision Support Systems, CDSS)에 LLM을 통합할 때의 위험 요소와 기회를 부각하기 위해.

제안 방법

  • 세 명의 경험이 풍부한 의료진이 환자의 증상 기반으로 LLM이 생성한 설명과 관련된 진단을 평가하는 다단계 실험을 수행함.
  • 전자 의무기록(Electronic Health Record, EHR) 스타일의 증상 기반으로 LLM을 사용해 텍스트 기반 설명을 생성함.
  • 다양한 단계에서 의료진 평가를 수집 및 분석함: 초기 진단, LLM 설명을 확인한 후, 설명 품질에 대한 평가 후.
  • LLM 설명 노출 전후로 의료진과 진단 간의 동의율을 정량적으로 분석함.
  • LLM 오류에 대한 정성적 분석을 수행함. 주요 초점은 사실 오류, 과도한 해석, 증상의 오인정 등임.
  • 의사가 내린 진단과 LLM이 생성한 설명을 비교하여 일관성과 신뢰성 평가함.
Figure 1: Inter-doctor agreement on what explanations are erroneous for GT predictions
Figure 1: Inter-doctor agreement on what explanations are erroneous for GT predictions

실험 결과

연구 질문

  • RQ1LLM이 생성한 설명은 주어진 진단 가설에 대한 의료진의 동의율에 어떤 영향을 미치는가?
  • RQ2LLM은 환자의 증상과 진단 간 연결을 설명할 때 어떤 종류의 사실 오류를 자주 범하는가?
  • RQ3다양한 증상-진단 쌍에 대해 LLM 설명의 품질은 어떻게 변동하는가?
  • RQ4임상 판단만으로 진단을 내리는 것과 비교해 LLM 설명은 진단 의사결정에 얼마나 큰 영향을 미치는가?
  • RQ5의료진은 LLM이 생성한 설명의 명확성과 임상적 관련성에 대해 어떻게 평가하는가?

주요 결과

  • LLM이 생성한 설명은 주어진 진단에 대한 의료진의 동의율을 유의미하게 높여 설득력 있는 영향을 보였다.
  • LLM 오류율은 5%에서 30%로 다양했으며, 가장 흔한 오류는 증상이 잘못된 진단에 연결되어 할당된 경우였다.
  • 주요 오류 유형 중 하나는 모델이 존재하지 않는 증상-진단 연결을 '창출'하는 경향이었으며, 특히 증상이 진단을 명확히 지지하지 못할 경우에 두드러졌다.
  • 의료진은 종종 LLM 설명의 사실 오류를 간과하고, 증상이 진단과 일치하는지 여부에 더 집중했다.
  • 연구에서 동일한 증상 집합에 대해 여러 가지 타당한 진단 가설이 존재할 수 있음을 밝혀냈으며, LLM 설명이 의료진이 어떤 진단을 수용할지에 영향을 미쳤다.
  • 다수의 경우 고품질의 설명이 존재했음에도 불구하고, 의료진 간 설명 품질에 대한 동의율은 낮아, 설명 품질 평가가 주관적이고 맥락 의존적임을 시사했다.
Figure 2: Inter-doctor agreement on what explanations are erroneous for MODEL predictions
Figure 2: Inter-doctor agreement on what explanations are erroneous for MODEL predictions

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.