Skip to main content
QUICK REVIEW

[논문 리뷰] RareBench: Can LLMs Serve as Rare Diseases Specialists?

Xuanzhong Chen, Xiaohao Mao|arXiv (Cornell University)|2024. 02. 09.
Cancer Genomics and DiagnosticsBiochemistry, Genetics and Molecular Biology인용 수 3
한 줄 요약

이 논문은 희귀질환 진단을 평가하기 위한 포괄적인 벤치마크인 RareBench를 소개한다. 정제된 희귀질환 지식 그래프를 활용한 동적 few-shot 프롬프팅 방법을 통해 GPT-4는 실제 환자 데이터셋에서 전문의보다 상위-1 재현율(0.520 대비 0.407)을 기록하며, 임상적 희귀질환 진단 분야에서 LLM의 강력한 잠재력을 입증한다.

ABSTRACT

Generalist Large Language Models (LLMs), such as GPT-4, have shown considerable promise in various domains, including medical diagnosis. Rare diseases, affecting approximately 300 million people worldwide, often have unsatisfactory clinical diagnosis rates primarily due to a lack of experienced physicians and the complexity of differentiating among many rare diseases. In this context, recent news such as "ChatGPT correctly diagnosed a 4-year-old's rare disease after 17 doctors failed" underscore LLMs' potential, yet underexplored, role in clinically diagnosing rare diseases. To bridge this research gap, we introduce RareBench, a pioneering benchmark designed to systematically evaluate the capabilities of LLMs on 4 critical dimensions within the realm of rare diseases. Meanwhile, we have compiled the largest open-source dataset on rare disease patients, establishing a benchmark for future studies in this domain. To facilitate differential diagnosis of rare diseases, we develop a dynamic few-shot prompt methodology, leveraging a comprehensive rare disease knowledge graph synthesized from multiple knowledge bases, significantly enhancing LLMs' diagnostic performance. Moreover, we present an exhaustive comparative study of GPT-4's diagnostic capabilities against those of specialist physicians. Our experimental findings underscore the promising potential of integrating LLMs into the clinical diagnostic process for rare diseases. This paves the way for exciting possibilities in future advancements in this field.

연구 동기 및 목표

  • 희귀질환 진단을 위한 LLM 평가의 허점, 즉 낮은 의료진 노출도와 표현형 복잡성으로 인한 높은 오진율로 인해 여전히 해결이 필요한 문제를 해결한다.
  • 진단 정확도, 내구성, 해석 가능성, 일반화 능력의 네 가지 핵심 차원에서 LLM을 체계적으로 평가한다.
  • 향후 연구를 지원하기 위해 베이징 연합의과대학병원(Peking Union Medical College Hospital, PUMCH)에서 확보한 희귀질환 환자 사례의 대규모 오픈소스 데이터셋을 구축한다.
  • 포괄적인 희귀질환 지식 그래프를 활용한 동적 few-shot 프롬프팅 전략을 통해 LLM의 진단 성능을 향상시킨다.
  • LLM의 진단 성능을 전문의와 직접 비교하여 임상적 관련성과 기준 벤치마크로서의 유용성을 확립한다.

제안 방법

  • OMIM, Orphanet, CCRD, HPO 등의 다양한 자료를 통합하여 질환-표현형 관계를 표현하는 희귀질환 지식 그래프를 구축한다.
  • 지식 그래프에 정보 콘텐츠 기반 무작위 보행 알고리즘을 적용하여 프롬프트 엔지니어링을 위한 다양한, 맥락적으로 관련성이 높은 few-shot 예제를 생성한다.
  • 입력 환자의 표현형 프로파일에 따라 few-shot 예제를 동적으로 조정하는 프레임워크를 설계하여 진단의 관련성을 향상시킨다.
  • 원시 EHR 텍스트가 아닌 표현형 기반 입력(증상, 징후, 가족력)을 사용하여 토큰 수를 줄이고 모델의 집중도 및 성능을 향상시킨다.
  • 75건의 실제 PUMCH 희귀질환 사례에서 제어된 평가를 수행하여, GPT-4와 다른 두 개의 LLM이 전문의와 비교되며 외부 지원 유무에 따라 평가된다.
  • 표준 평가 지표인 상위-1, 상위-3, 상위-10 재현율 및 중앙 순위를 사용하여 진단 정밀도와 순위 정확도를 평가한다.
Figure 1. RareBench ’s overview of evaluation results.
Figure 1. RareBench ’s overview of evaluation results.

실험 결과

연구 질문

  • RQ1LLM은 희귀질환 감별 진단에서 전문의보다 더 높은 진단 정확도를 달성할 수 있는가?
  • RQ2원시 EHR 텍스트에 비해 표현형 기반 입력이 LLM의 진단 성능 향상에 어떤 영향을 미치는가?
  • RQ3희귀질환 지식 그래프에 기반한 동적 few-shot 프롬프팅 전략이 LLM의 진단 추론 능력 향상에 어느 정도 기여하는가?
  • RQ4특히 표현형 겹침이 빈번한 심장내과와 같은 분야에서 다양한 의료 전문 분야 간에 진단 성능 지표는 어떻게 달라지는가?
  • RQ5외부 임상 지원이 희귀질환 진단에서 전문의와 LLM 양쪽에 미치는 비교적 영향은 어떠한가?

주요 결과

  • GPT-4는 표현형 기반 입력을 사용할 경우 상위-1 재현율 0.520을 기록하였으며, 보조 없이 진단한 전문의(0.407)와 보조를 받은 전문의(0.447)를 모두 앞섰다.
  • GPT-4의 상위-3 재현율은 표현형 입력을 사용했을 때 0.747에 도달하였으며, 보조 없이 진단한 전문의의 0.468과 보조를 받은 전문의의 0.511을 초월하였다.
  • 추출된 표현형을 사용함으로써 입력 토큰 수가 감소하고, 원시 EHR 텍스트보다 진단 성능이 향상되었으며, 이 경우 GPT-4의 상위-1 재현율은 0.453을 기록하였다.
  • 평가한 다섯 개의 의료 분야 전반에서 GPT-4는 상위-1 및 상위-3 재현율 모두에서 전문의를 뛰어넘었으며, 소아과에서 가장 높은 성능, 심장내과에서 가장 낮은 성능를 보였다.
  • 심장내과 사례는 모든 모델에서 가장 열악한 성능를 보였으며, 이는 증상의 겹침과 영상 및 검사 결과 의존성으로 인해 발생했을 가능성이 높아, 다중모달 LLM이 필요함을 시사한다.
  • 지식 그래프에 기반한 동적 few-shot 프롬프팅 방법은 LLM의 진단 추론 능력과 순위 정확도를 상당히 향상시켰다.
Figure 2. RareBench is the first pioneering benchmark to evaluate LLMs as rare disease specialists on 4 distinct tasks.
Figure 2. RareBench is the first pioneering benchmark to evaluate LLMs as rare disease specialists on 4 distinct tasks.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.