[논문 리뷰] Diagnostic Reasoning Prompts Reveal the Potential for Large Language Model Interpretability in Medicine
이 연구는 GPT-4가 임상의의 단계적 추론 방식—예를 들어, 감별진단, 베이지안 추론, 분석적 추론 등을 모방할 수 있도록 하는 새로운 진단 추론 프롬프트를 제안한다. 이는 높은 진단 정확도를 유지하면서 이루어진다. GPT-4는 정확도를 희생시키지 않은 채 이해하기 쉬운 임상적 근거를 생성함으로써 GPT-3.5를 능가하며, 의료 분야에서 신뢰할 수 있고 투명한 대규모 언어 모델 사용을 위한 중요한 진전을 보여준다.
One of the major barriers to using large language models (LLMs) in medicine is the perception they use uninterpretable methods to make clinical decisions that are inherently different from the cognitive processes of clinicians. In this manuscript we develop novel diagnostic reasoning prompts to study whether LLMs can perform clinical reasoning to accurately form a diagnosis. We find that GPT4 can be prompted to mimic the common clinical reasoning processes of clinicians without sacrificing diagnostic accuracy. This is significant because an LLM that can use clinical reasoning to provide an interpretable rationale offers physicians a means to evaluate whether LLMs can be trusted for patient care. Novel prompting methods have the potential to expose the black box of LLMs, bringing them one step closer to safe and effective use in medicine.
연구 동기 및 목표
- 대규모 언어 모델(Large Language Models, LLMs)이 구조화된 프롬프팅 기법을 사용하여 임상적으로 관련 있는 추론를 수행할 수 있는지 평가하기 위해.
- GPT-4가 진단 정확도를 잃지 않고도 핵심 임상적 추론 과정—감별진단, 직관적 추론, 분석적 추론, 베이지안 추론—을 재현할 수 있는지 평가하기 위해.
- 의료 결정 과정에서 LLM의 '블랙박스' 성격을 드러내는 데 목적이 있는 새로운 프롬프팅 전략을 개발하고 테스트하기 위해.
- 자유형 응답 임상 추론 과제에서 LLM의 해석 가능성 평가를 위한 벤치마크를 수립하기 위해.
- 향후 임상 워크플로우에서 투명하고 신뢰할 수 있는 LLM 개발을 위한 기초를 마련하기 위해.
제안 방법
- 표준 임상 인지 과정을 모델로 삼아, 감별진단, 분석적 추론, 베이지안 추론, 직관적 추론을 위한 네 가지 전문화된 진단 추론 프롬프트를 개발하였다.
- 추론 중 모델 행동을 이끌기 위해, 각 프롬프트당 두 개의 예시 케이스를 포함한 소수 샘플 프롬프팅을 사용하였다.
- 518개의 임상 케이스 질문을 포함하는 수정된 자유형 응답 MedQA USMLE 데이터셋을 사용하여 GPT-3.5와 GPT-4를 평가하였다.
- 의사 주도의 익명 평가와 상호 평가자 간 신뢰도 검증(Cohen’s Kappa = 0.98)을 통해 응답 정확도를 평가하였다.
- 비교를 위한 기준으로 기존의 체인 오브 톰(Chain-of-Thought, CoT) 프롬프팅을 적용하였다.
- 추론에 OpenAI API를 사용하였으며, Davinci-003(GPT-3.5)와 GPT-4를 활용하였다; 제출 시점에 GPT-4의 자기 일관성(self-consistency)이 이용 불가능하여 적용하지 않았다.
실험 결과
연구 질문
- RQ1GPT-4는 진단 정확도를 유지하면서도, 구조화되고 의료 전문가의 사고 방식을 반영한 추론 전략을 사용해 임상적 추론을 수행할 수 있는가?
- RQ2GPT-4가 진단 추론 프롬프트를 사용할 경우, 기존의 체인 오브 톰 프롬프팅과 비교해 성능가능성은 어떠한가?
- RQ3GPT-3.5는 고급 진단 프롬프트를 사용할 경우 동일한 해석 가능성과 추론 능력을 보여주는가?
- RQ4특수화된 프롬프팅 기법을 통해 LLM의 내부 추론 과정을 드러내어 임상 환경에서의 '블랙박스' 성격을 감소시킬 수 있는가?
- RQ5진단 추론 프롬프트를 사용한 LLM이 생성한 근거들이 논리적으로 타당하고 임상적으로 타당한가?
주요 결과
- GPT-4는 기존의 체인 오브 톰 프롬프팅을 사용할 경우 92.5%의 진단 정확도를 기록했고, 진단 추론 프롬프트를 사용할 경우 92.3%의 정확도를 기록하여 유의미한 성능 저하가 없음을 확인하였다.
- GPT-3.5는 감별진단, 분석적 추론, 베이지안 추론 프롬프트를 사용할 경우 정확도가 유의미하게 떨어져, 제한된 추론 능력을 보여주었다.
- GPT-4는 진단 정확도를 유지하면서도 감별진단, 분석적 추론, 베이지안 추론, 직관적 추론의 네 가지 임상적 추론 전략을 모두 성공적으로 모방하였다.
- 의사들이 GPT-4의 응답을 평가한 결과, 상호 평가자 간 일치도는 99%였고, Cohen’s Kappa는 0.98로 매우 높은 신뢰도를 보였다.
- 이 연구는 GPT-4가 이해하기 쉬우면서도 임상적으로 타당한 근거를 생성할 수 있음을 입증하며, 의료 분야에서 신뢰할 수 있는 LLM 통합을 위한 길을 제시한다.
- 결과적으로, GPT-3.5에서 GPT-4로의 추론 능력 향상이 특히 구조화된 임상적 추론 프롬프트 환경에서 뚜렷하게 나타나, 중요한 발전을 이룬 것으로 나타났다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.