[논문 리뷰] How well do LLMs cite relevant medical references? An evaluation framework and analyses
이 논문은 SourceCheckup을 도입하여 LLM의 인용된 출처가 의학 진술을 얼마나 잘 뒷받침하는지 평가하는 자동 파이프라인을 소개하고, 상위 모델 전체에서 뒷받침에 상당한 차이가 있음을 발견하며, 전문가 주석이 포함된 의학 QA 데이터셋을 공개한다.
Large language models (LLMs) are currently being used to answer medical questions across a variety of clinical domains. Recent top-performing commercial LLMs, in particular, are also capable of citing sources to support their responses. In this paper, we ask: do the sources that LLMs generate actually support the claims that they make? To answer this, we propose three contributions. First, as expert medical annotations are an expensive and time-consuming bottleneck for scalable evaluation, we demonstrate that GPT-4 is highly accurate in validating source relevance, agreeing 88% of the time with a panel of medical doctors. Second, we develop an end-to-end, automated pipeline called extit{SourceCheckup} and use it to evaluate five top-performing LLMs on a dataset of 1200 generated questions, totaling over 40K pairs of statements and sources. Interestingly, we find that between ~50% to 90% of LLM responses are not fully supported by the sources they provide. We also evaluate GPT-4 with retrieval augmented generation (RAG) and find that, even still, around 30\% of individual statements are unsupported, while nearly half of its responses are not fully supported. Third, we open-source our curated dataset of medical questions and expert annotations for future evaluations. Given the rapid pace of LLM development and the potential harms of incorrect or outdated medical information, it is crucial to also understand and quantify their capability to produce relevant, trustworthy medical references.
연구 동기 및 목표
- 자동화된 프레임워크를 개발하여 의학 Q&A에서 LLM의 출처 귀속을 평가한다.
- 전문가 주석이 포함된 의학 질문/답변 데이터셋을 만들어 출처 검증을 수행한다.
- 소스 지원 측면에서 최상위 LLM들(GPT-4 RAG/API, Claude v2.1, Mistral Medium, Gemini Pro)을 평가한다.
- URL 유효성, 진술-수준 지원, 응답-수준 지원에 대한 지표를 정량화한다.
- 의학 신뢰 가능한 AI를 위한 미래 벤치마킹 가능하도록 큐레이션 데이터의 오픈 소스를 제공한다.
제안 방법
- Four-module SourceCheckup 파이프라인: 질문 생성, LLM 질문 응답, 진술 및 URL 출처 파싱, 출처 검증.
- Mayo Clinic, UpToDate, Reddit r/AskDocs의 1200개 참조 페이지에서 새로운 의학 질문을 생성하는 데 GPT-4를 사용.
- LLM은 텍스트와 인용된 URL을 담은 응답을 제공하고, 응답은 개별 진술로 파싱된다.
- URL을 다운로드하고 일반 텍스트로 변환하며, 내용은 GPT-4의 128K 토큰 한도에 맞춰 잘라낸다.
- 진술-출처 쌍은 자동으로 출처 검증 모델(GPT-4)로 지원 여부가 평가된다.
- 세 가지 지표: 출처 URL 유효성(200 OK), 진술-수준 지원(어떤 출처든 진술을 뒷받침), 응답-수준 지원(모든 진술이 뒷받침).
- 전문가 검증: 미국 면허 의사에 대해 GPT-4 자동 작업을 검증했으며 출처 관련성에서 88%의 일치.

실험 결과
연구 질문
- RQ1LLM이 생성한 의학 진술에 대해 제공된 인용에서 뒷받침하는 출처가 얼마나 많이 포함되어 있는가?
- RQ2LLMs가 주장들을 실제로 뒷받침하는 유효하고 검색 가능한 URL을 얼마나 자주 생성하는가?
- RQ3검색 기반 생성(RAG)이 출처 지원을 개선하는가, 개선 정도는 얼마나 되는가?
- RQ4출처 지원은 질문 소스(Mayo Clinic, UpToDate, Reddit r/AskDocs)에 따라 어떻게 다르는가?
- RQ5상위 LLM이 일반적으로 인용하는 출처의 품질과 구성이 어떤가? (도메인, 미국 기반 대 비미국, 유료벽 여부)
주요 결과
- 다섯 가지 상위 모델에서, 응답의 50%에서 90%가 제공된 출처로 충분히 뒷받침되지 않는다.
- RAG를 적용한 GPT-4가 가장 우수한 인용 능력을 보였지만, 응답 수준에서 완전히 뒷받침되는 비율은 약 54%에 불과하다.
- GPT-4 API는 진술-수준 지원이 더 높게 나타나며(일부 경우 URL 유효성 약 70% 이상, 진술-수준 지원도 >70%),
- 모든 API 엔드포인트 모델은 상당한 URL 사용을 보이나 완전한 지원 비율은 낮고, Gemini Pro는 약 7% 정도가 완전히 지원된다.
- RAG는 URL 유효성과 URL 환각 감소에 도움이 되지만 전문가들은 검증 작업이 여전히 도전적이라고 동의한다; 의사들은 샘플 쌍에서 약 86-96%의 경우에 출처 검증 모델과 일치한다고 응답한다.
- 대부분의 인용 출처는 미국 기반(.org/.gov)이며 Mayo Clinic, NIH, CDC의 출처에서 오며, 유료벽 페이지나 폐쇄 페이지는 드물다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.