Skip to main content
QUICK REVIEW

[논문 리뷰] ChatGPT-HealthPrompt. Harnessing the Power of XAI in Prompt-Based Healthcare Decision Support using ChatGPT

Fatemeh Nazary, Yashar Deldjoo|arXiv (Cornell University)|2023. 08. 17.
Artificial Intelligence in Healthcare and Education인용 수 6
한 줄 요약

이 논문은 OpenAI의 ChatGPT를 위한 프롬프트 엔지니어링에 해석 가능한 기계학습 모델(예: XGBoost)으로부터 도메인 지식을 통합함으로써 임상 의사결정 지원을 향상시키는 새로운 프레임워크인 ChatGPT-HealthPrompt를 제안한다. 특성 기여도 정보를 맥락 프롬프트로 통합함으로써, 낮은 데이터 환경에서도 기존의 지도 학습 모델과 비슷한 소수 예제 성능을 달성하며, 이는 인공지능 기반 프롬프트 설계가 의료 응용 분야에서 정확성과 해석 가능성에 크게 기여함을 보여준다.

ABSTRACT

This study presents an innovative approach to the application of large language models (LLMs) in clinical decision-making, focusing on OpenAI's ChatGPT. Our approach introduces the use of contextual prompts-strategically designed to include task description, feature description, and crucially, integration of domain knowledge-for high-quality binary classification tasks even in data-scarce scenarios. The novelty of our work lies in the utilization of domain knowledge, obtained from high-performing interpretable ML models, and its seamless incorporation into prompt design. By viewing these ML models as medical experts, we extract key insights on feature importance to aid in decision-making processes. This interplay of domain knowledge and AI holds significant promise in creating a more insightful diagnostic tool. Additionally, our research explores the dynamics of zero-shot and few-shot prompt learning based on LLMs. By comparing the performance of OpenAI's ChatGPT with traditional supervised ML models in different data conditions, we aim to provide insights into the effectiveness of prompt engineering strategies under varied data availability. In essence, this paper bridges the gap between AI and healthcare, proposing a novel methodology for LLMs application in clinical decision support systems. It highlights the transformative potential of effective prompt design, domain knowledge integration, and flexible learning approaches in enhancing automated decision-making.

연구 동기 및 목표

  • 프롬프트 튜닝 없이도 ChatGPT와 같은 대규모 언어 모델을 이진 분류 작업에 활용할 수 있는지 여부를 조사하는 것.
  • 해석 가능한 기계학습 모델(예: XGBoost, 랜덤 포레스트)에서 유래한 도메인 특화 지식을 통합함으로써 의료 분야에서 프롬프트 기반 추론 성능이 어떻게 향상되는지 탐색하는 것.
  • 의료 분류 작업에서 소수 예제와 제로 샷 프롬프팅 전략 간 성능, 신뢰성 및 오류 프로파일(FP/FN)을 비교하는 것.
  • 전문가가 유도한 통찰을 활용한 프롬프트 엔지니어링이 데이터가 부족한 환경에서 기존의 지도 학습 모델과의 성능 격차를 줄일 수 있는지 평가하는 것.
  • LLM 기반 진단 시스템에서 잠재적 오류 프로파일(FP/FN)의 상호 교환 관계를 평가하고 임상 안전성에 미치는 영향을 분석하는 것.

제안 방법

  • 작업 설명, 입력 특성 설명, 그리고 훈련된 해석 가능한 기계학습 모델(예: XGBoost, 랜덤 포레스트, 로지스틱 회귀)에서 추출한 도메인 지식을 포함하는 맥락 프롬프트를 구성한다.
  • 도메인 지식은 훈련된 해석 가능한 모델에서 유도된 특성 기여도 점수(MLFI) 및 순서화된 특성 기여도(MLFI-ord)로부터 유도되며, 이는 추론 단서로 프롬프트에 통합된다.
  • 프롬프트에 8개 또는 16개의 주석이 달린 예시를 포함함으로써 소수 예제 프롬프팅을 구현하며, 각 예시는 임상 특성과 이진 결과(예: 심장병 유무)를 포함한 사례 서술 형식으로 구성된다.
  • 기본 비교군으로 제로 샷 프롬프팅을 사용하며, 이는 예시 없이 작업 지시와 입력만 제공된다.
  • 표준 평가 지표를 사용해 성능을 평가한다: 여러 프롬프트 유형과 모델 구성에서 정확도, F1 점수, 정밀도, 재현율, 그리고 임계값 기반의 양성/음성 오류 비율.
  • 훈련된 해석 가능한 모델을 '의료 전문가'로 간주하여 실질적인 통찰을 추출하고, 이를 인간이 이해할 수 있는 형식으로 LLM의 추론 과정을 안내하는 데 활용한다.
Figure 1 : Flowchart illustrating the conceptual framework of the paper
Figure 1 : Flowchart illustrating the conceptual framework of the paper

실험 결과

연구 질문

  • RQ1해석 가능한 기계학습 모델에서 유도된 도메인 지식이 소수 예제 기반 추론 성능을 대규모 언어 모델에서 임상 의사결정 지원에 크게 향상시킬 수 있는가?
  • RQ2다양한 데이터 가용성 수준에서 제로 샷 및 소수 예제 프롬프팅 전략의 ChatGPT 성능이 기존의 지도 학습 기반 기계학습 모델과 비교해 어떻게 다른가?
  • RQ3XGBoost 및 기타 모델에서 유도된 특성 기여도와 순서화된 특성 기여도를 통합함으로써 LLM의 예측 신뢰성과 해석 가능성은 어떻게 영향을 받는가?
  • RQ4LLM 기반 프롬프팅과 전통적인 기계학습 모델 간의 양성 및 음성 오류 비율은 어떻게 다를 수 있으며, 이러한 오류 프로파일은 임상적 의미를 어떻게 갖는가?
  • RQ5전문가가 유도한 통찰을 활용한 프롬프트 엔지니어링을 통해 의료 분야의 LLM 응용에서 데이터 의존도는 어느 정도 감소시킬 수 있는가?

주요 결과

  • 16개의 예시를 포함한 소수 예제 환경에서 ChatGPT-HealthPrompt는 평균 F1 점수 0.8193을 기록했으며, 일부 구성에서는 기존의 지도 학습 모델의 성능을 도달하거나 초월했다.
  • MLFI 및 MLFI-ord 특성을 통한 도메인 지식 통합으로 성능 향상이 이루어졌으며, XGBoost에서 유도된 통찰을 프롬프트에 통합했을 때 최고의 F1 점수 0.9267을 기록했다.
  • 제로 샷 기반 모델 대비 ChatGPT의 성능 향상이 뚜렷했으며, 16개의 예시를 사용했을 때 평균 F1 점수는 제로 샷의 0.7608에서 소수 예제의 0.8193으로 상승했다.
  • 전통적 모델 대비 높은 양성 오류 비율(FP)을 보였지만(소수 예제 설정에서 평균 11.54), 음성 오류 비율은 낮게 유지되어 고위험 진단 환경에서 더 안전한 오류 프로파일을 보였다.
  • XGBoost 기반 프롬프트에 16개의 예시를 사용했을 때 최대 정확도 0.9428과 F1 점수 0.9428을 기록하여 데이터가 부족한 조건에서도 뛰어난 성능을 보였다.
  • 프롬프트에 순서화된 특성 기여도(MLFI-ord)를 통합했을 때 모든 구성 중에서 가장 높은 F1 점수(0.9267)를 기록했으며, 이는 특성의 체계적 정렬이 LLM의 추론 능력을 향상시킨다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.