[논문 리뷰] Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering
이 논문은 LLM을 사용한 개방형 의료 질의 응답을 위한 새로운 소수 샘플 사고 흐름 프롬프팅 방법—점진적 추론—을 제안한다. 실제 임상적 추론을 모방하고 인간 검증 보상 모델을 통합하여 응답 검증 기능을 강화함으로써, 표준 CoT 프롬프팅보다 유의미하게 뛰어난 성능을 보이며, Llama2-7B를 사용한 100문항 평가에서 추론 품질과 정확도에 대해 전문가의 일치도가 86%에 이를 정도로 높다.
In this paper, we propose a modified version of the MedQA-USMLE dataset, named MEDQA-OPEN, which contains open-ended medical questions without options to mimic clinical scenarios, along with clinician-approved reasoned answers. Additionally, we implement a prompt driven by Chain of Thought (CoT) reasoning, CLINICR, to mirror the prospective process of incremental reasoning, reaching a correct response to medical questions. We empirically demonstrate how CLINICR outperforms the state-of-the-art 5-shot CoT-based prompt (Liévin et al., 2022). We also present an approach that mirrors real-life clinical practice by first exploring multiple differential diagnoses through MCQ-CLINICR and subsequently narrowing down to a final diagnosis using MCQ-ELIMINATIVE. Finally, emphasizing the importance of response verification in medical settings, we utilize a reward model mechanism, replacing the elimination process performed by MCQ-ELIMINATIVE.
연구 동기 및 목표
- 기존 의료 질의 응답 데이터셋은 주로 다중선택형이므로, 개방형 추론을 가능하게 하기 위해 선택지를 제거한 수정된 MedQA-USMLE 데이터셋을 생성함으로써 이 격차를 메우는 것.
- 단일 단계 CoT가 아닌 단계별로 점진적인 추론을 통해 실제 임상적 의사결정 과정을 모방하는 프롬프팅 전략을 개발하는 것.
- 의료 전문가가 평가한 추론-응답 쌍을 기반으로 보상 모델을 훈련시켜 의료 LLM의 응답 검증 가능성을 향상시키는 것.
- 기존의 프롬프팅 방법(예: Codex CoT, 프롬프트 체이닝)과 비교하여 점진적 추론 프롬프팅과 검증자 기반 선택 전략의 효과를 평가하는 것.
제안 방법
- 원본 MedQA-USMLE 데이터셋에서 선택지를 제거하여 개방형 응답 생성이 가능한 새로운 데이터셋인 MedQA-No-Opt를 구축함.
- 의료 전문가의 진단 워크플로우를 모방하는 단계적이고 전방향 추론을 유도하는 점진적 추론 프롬프팅을 설계함.
- Llama2-7b-chat 모델을 점진적 추론 템플릿으로 프롬프팅하여 추론 흐름을 생성하고, 이를 의료 전문가가 검증함.
- 쌍별 선호도 학습을 통한 보상 모델 구축: 동일한 질문에 대해 올바른(긍정적) 및 잘못된(부정적) 응답-추론 쌍을 사용하고, 보상 마진은 0.4로 설정함.
- LoRA를 사용하여 Llama2-7b-chat 모델을 보상 모델링에 맞게 피팅하고, 손실 함수를 다음과 같이 정의함: $\mathcal{L}^{rw} = -\log(\sigma(r_{\boldsymbol{\phi}}(q_i, o^{c}_i) - r_{\boldsymbol{\phi}}(q_i, o^{r}_i) - m(r)))$.
- 훈련된 보상 모델을 활용해 MedCodex 소수 샘플 프롬프팅을 통해 생성된 네 가지 응답 중 점수 가장 높은 것을 선택함으로써, 검증자 기반 응답 선택을 실현함.

실험 결과
연구 질문
- RQ1표준 소수 샘플 CoT 프롬프팅에 비해 점진적 추론 프롬프팅이 개방형 의료 질의 응답에서 LLM 생성 응답의 품질과 정확도를 향상시키는가?
- RQ2의료 전문가가 검증한 추론-응답 쌍을 기반으로 훈련된 보상 모델이 의료 LLM에서 고품질 응답의 선택을 얼마나 향상시키는가?
- RQ3검증자 기반 응답 선택 전략이 프롬프트 체이닝 및 제거 기반 추론과 같은 전통적 프롬프팅 방법보다 임상적 추론 과제에서 더 우수한 성능을 보이는가?
- RQ4점진적 추론 방법의 성능은 다양한 LLM 파라미터 스케일(특히 Llama2-7B와 같은 작은 모델에 적용했을 때)에서 어떻게 변화하는가?
- RQ5의료 데이터에 대해 피팅되지 않은 모델이라도 추론 품질 기반으로 훈련된 보상 모델이 정확한 응답 선택을 효과적으로 이끌 수 있는가?
주요 결과
- Llama2-7B 모델을 사용한 MedQA-No-Opt 데이터셋에서 100문항 평가 결과, 점진적 추론 프롬프팅은 추론 품질과 최종 정답 정확도에서 전문가의 일치도가 86%에 이를 정도로 높은 성능을 보였다.
- 검증자 기반 응답 선택 전략은 프롬프트 체이닝 및 제거 기반 추론과 같은 기준 프롬프팅 방법보다 정확하고 설명 가능한 응답 선택에서 뚜렷한 우월성을 보였다.
- 특히 다단계 진단 추론이 필요한 특정 임상적 추론 시나리오에서는 점진적 추론 방법이 수정된 5샷-Codex-CoT 프롬프팅보다 뛰어난 성능을 보였다.
- 점진적 추론 방법을 사용한 그리디 디코딩 전략이 다른 디코딩 전략보다 더 우수한 결과를 도출하였으며, 이는 일관된 추론을 생성하는 데 있어 강건성과 신뢰성을 입증한다.
- 의료 전문가가 검증한 추론 쌍을 기반으로 훈련된 보상 모델은 정확한 응답과 잘못된 응답을 효과적으로 구분하는 데 강력한 능력을 보였으며, 정답이더라도 추론의 결함을 신뢰성 있게 식별할 수 있었다.
- 향상된 프롬프팅과 검증 전략을 통해 더 큰 모델보다도 뛰어난 성능을 낼 수 있는 잠재력이 있으며, 이는 고도화된 프롬프팅과 검증 전략가 모델 크기의 제약을 상쇄시킬 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.