Skip to main content
QUICK REVIEW

[논문 리뷰] Can large language models reason about medical questions?

Valentin Liévin, Christoffer Hother|arXiv (Cornell University)|2022. 07. 17.
Topic Modeling인용 수 85
한 줄 요약

이 논문은 질의응답 의료 벤치마크에서 GPT-3.5 패밀리와 오픈 소스 LLM을 제로샷/페샷 및 연쇄적 사고(CoT) 프롬프트로 평가하고, 검색 보강 여부에 따라 USMLE, MedMCQA, PubMedQA에서 특정 프롬프트/계산 설정 하에 거의 합격에 가까운 성능을 보임을 보여준다.

ABSTRACT

Although large language models (LLMs) often produce impressive outputs, it remains unclear how they perform in real-world scenarios requiring strong reasoning skills and expert domain knowledge. We set out to investigate whether close- and open-source models (GPT-3.5, LLama-2, etc.) can be applied to answer and reason about difficult real-world-based questions. We focus on three popular medical benchmarks (MedQA-USMLE, MedMCQA, and PubMedQA) and multiple prompting scenarios: Chain-of-Thought (CoT, think step-by-step), few-shot and retrieval augmentation. Based on an expert annotation of the generated CoTs, we found that InstructGPT can often read, reason and recall expert knowledge. Last, by leveraging advances in prompt engineering (few-shot and ensemble methods), we demonstrated that GPT-3.5 not only yields calibrated predictive distributions, but also reaches the passing score on three datasets: MedQA-USMLE 60.2%, MedMCQA 62.7% and PubMedQA 78.2%. Open-source models are closing the gap: Llama-2 70B also passed the MedQA-USMLE with 62.5% accuracy.

연구 동기 및 목표

  • GPT-3.5 계열 모델(InstructGPT, Codex)이 의료 QA 벤치마크(USMLE, MedMCQA, PubMedQA)에서 어떻게 수행되는지 평가한다.
  • 의료 추론을 위한 제로샷, 페샷, 직접 프롬프트 및 Chain-of-Thought 프롬프트, 더불어 검색 보강의 효과를 평가한다.
  • 동일 벤치마크에서 오픈 소스 모델(Llama-2, Vicuna, Guanaco, Falcon 등)을 평가하고 보정(calibration) 및 편향을 분석한다.

제안 방법

  • 의료 QA 데이터셋에서 제로샷, 직접 프롬프트 및 제로샷 CoT 프롬프트를 비교한다.
  • CoT 설명이 있는 경우와 없는 경우의 페샷 프롬프트를 포함한다.
  • BM25 검색기와 위키피디아 문단을 이용한 검색 보강 프롬프트를 실험한다.
  • 불확실성과 보정을 위해 앙상블 샘플링(자체 일관성) 및 추론 시간 계산(Codex 5-shot CoT with k=100)을 사용하여 분석한다.
  • 생성된 CoT에 대한 전문가 주석을 수행하여 추론, 지식 회상, 독해를 평가한다.
  • MedQA-USMLE 및 MedMCQA 데이터셋에서 오픈 소스 모델(7B–70B)을 Codex와 벤치마크한다.

실험 결과

연구 질문

  • RQ1InstructGPT와 Codex가 제로샷 및 페샷 프롬프트를 사용하여 MedQA-USMLE, MedMCQA, PubMedQA에서 합격 정확도를 달성할 수 있는가?
  • RQ2직접 프롬프트와 비교하여 체인-오브-톡(CoT) 프롬프트가 의료 문제 해결 정확도와 해석 가능성을 향상시키는가?
  • RQ3검색 보강과 앙상블 샘플링이 정확도와 보정을 향상시키는가?
  • RQ4이러한 의료 벤치마크에 대해 오픈 소스 LLM이 독점형 모델과 어떻게 비교되는가?
  • RQ5의료 추론 프롬프트와 CoT 출력에서 어떤 편향과 실패 모드가 나타나는가?

주요 결과

  • 프롬프팅을 활용한 GPT-3.5 패밀리는 특정 프롬프팅 및 계산 조건에서 세 가지 의료 데이터셋에서 합격 점수에 도달할 수 있다.
  • Codex 5-shot CoT with ensemble sampling (k=100) passes USMLE (60.2%), MedMCQA (62.7%), and PubMedQA (78.2%).
  • 오픈 소스 모델(예: Llama-2 70B)은 USMLE 성능에서 일부 폐쇄형 모델에 근접하거나 이를 능가할 수 있으며(예: 5-shot CoT에서 62.5%), 전반적으로 격차를 좁힐 수 있다.
  • 제로샷 직접 프롬프트는 이러한 의료 벤치마크에서 미세조정된 BERT 기초 모델보다 성능이 우수하며, 제로샷 CoT 프롬프트는 해석 가능한 추론을 제공하지만 항상 직접 프롬프트보다 정확도가 높지는 않다.
  • 검색 보강은 점진적인 이득을 제공하고, 앙상블/자체 일관성 샘플링은 신뢰성과 보정을 향상시킨다.
  • 전문가 인적 평가에 따르면 InstructGPT는 많은 CoT에서 읽고 추론하며 전문가 지식을 기억할 수 있지만 오류와 편향은 여전히 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.