Skip to main content
QUICK REVIEW

[논문 리뷰] Clinfo.ai: An Open-Source Retrieval-Augmented Large Language Model System for Answering Medical Questions using Scientific Literature

Alejandro Lozano, Scott L. Fleming|arXiv (Cornell University)|2023. 10. 24.
Topic Modeling인용 수 6
한 줄 요약

Clinfo.ai는 임상 질문에 대해 동적으로 관련 과학 문헌을 검색하고 융합하여 답변하는 오픈소스, 검색 증강형 대규모 언어 모델 시스템이다. PubMedRS-200 벤치마크에서 다른 오픈소스 질문 응답 시스템보다 뛰어나며, 종합적으로 UniEval 점수를 최대 14.9% 높게 기록했고, 특히 TL;DR 요약에서 뛰어난 성능을 보이며, 원천 시스템적 리뷰에 의존하지 않고도 강력하고 정확한 의료 질문 응답 능력을 입증했다.

ABSTRACT

The quickly-expanding nature of published medical literature makes it challenging for clinicians and researchers to keep up with and summarize recent, relevant findings in a timely manner. While several closed-source summarization tools based on large language models (LLMs) now exist, rigorous and systematic evaluations of their outputs are lacking. Furthermore, there is a paucity of high-quality datasets and appropriate benchmark tasks with which to evaluate these tools. We address these issues with four contributions: we release Clinfo.ai, an open-source WebApp that answers clinical questions based on dynamically retrieved scientific literature; we specify an information retrieval and abstractive summarization task to evaluate the performance of such retrieval-augmented LLM systems; we release a dataset of 200 questions and corresponding answers derived from published systematic reviews, which we name PubMed Retrieval and Synthesis (PubMedRS-200); and report benchmark results for Clinfo.ai and other publicly available OpenQA systems on PubMedRS-200.

연구 동기 및 목표

  • PubMed에서 매년 100만 페퍼를 초과하는 급격히 증가하는 의료 문헌을 따라잡기 어려운 임상의 및 연구자들이 겪는 과제를 해결하기 위해.
  • 의료 질문 응답 분야에서 검색 증강형 LLM을 평가하기 위한 고품질 데이터셋과 표준화된 벤치마크 과제의 부족을 해결하기 위해.
  • 임상 질문에 대해 관련 문헌을 검색하고 개괄적 요약을 생성하는 오픈소스, 종단간(end-to-end) 시스템인 Clinfo.ai를 개발하고 공개하기 위해.
  • 200개의 임상 질문과 시스템적 리뷰에서 유래한 답변을 포함한 데이터셋인 PubMedRS-200을 소개하여 LLM 기반 시스템의 재현 가능한 평가를 가능하게 하기 위해.
  • 정보 검색과 개괄적 요약 과제를 통합한 표준화된 평가 프레임워크를 제공하여, 황금 표준 및 원천 없는 메트릭을 모두 포함하기 위해.

제안 방법

  • Clinfo.ai는 LLM이 생성한 질의를 사용해 먼저 관련 PubMed 논문을 검색하는 검색 증강 생성(RAG) 파이프라인을 사용한다.
  • 微조정된 LLM을 사용해 검색된 문헌에서 간결하고 개괄적인 요약(TL;DR)과 더 자세한 융합 요약을 생성한다.
  • 정보 검색과 개괄적 요약이라는 이중 과제 벤치마크를 사용해 평가하며, 모두 인간이 생성한 황금 표준과 비교한다.
  • 실제 운영 환경을 시뮬레이션하기 위해 제한 없음, 제한 있음, 원천 없는 검색 등 다양한 평가 제도를 포함한다.
  • 요약 품질과 관련성 평가를 위해 UniEval, BERTScore, ROUGE-L, METEOR, CTC 등의 자동화된 메트릭을 사용한다.
  • PubMedRS-200 데이터셋은 공개된 시스템적 리뷰에서 추출한 200개 질문에서 유래했으며, 정확성과 대표성을 확보하기 위해 답변과 참고문헌을 정제했다.
Figure 1: Schematic Representation of the Protocol for Retrieving Abstracts from PubMed and Generating Title-Based Questions
Figure 1: Schematic Representation of the Protocol for Retrieving Abstracts from PubMed and Generating Title-Based Questions

실험 결과

연구 질문

  • RQ1Clinfo.ai와 같은 검색 증강형 LLM 시스템이 과학 문헌을 활용해 임상 질문에 대해 다른 폐쇄형 도구보다 뛰어난 성능을 보일 수 있는가?
  • RQ2Clinfo.ai의 성능은 제한 없음, 제한 있음, 원천 없는 검색 조건을 포함한 다양한 평가 제도에서 어떻게 변화하는가?
  • RQ3Clinfo.ai의 성능가 원천 시스템적 리뷰의 접근성에 얼마나 의존하는가? 그리고 그것이 없더라도 높은 품질의 요약을 생성할 수 있는가?
  • RQ4자동화된 평가 메트릭이 의료 질문 응답 및 요약 맥락에서 인간의 선호도와 얼마나 상관이 있는가?
  • RQ5TL;DR(너무 길어서 읽지 않음) 요약 형식이 전체 개괄적 융합 요약과 비교해 모델 성능 향상에 어떤 역할을 하는가?

주요 결과

  • Clinfo.ai는 다른 시스템 대비 최대 14.9% 높은 UniEval 종합 점수를 기록하여, 검색 증강형 질문 응답에서 뛰어난 성능을 입증했다.
  • Clinfo.ai의 TL;DR 요약 모드는 동일한 검색된 논문을 사용함에도 불구하고 전체 융합 요약 및 융합+TL;DR 조합 모드보다 뚜렷이 뛰어난 성능을 보였다.
  • 원천 시스템적 리뷰에 접근할 수 없는 상황에서도 Clinfo.ai는 다른 시스템의 요약보다 황금 표준 결론과 더 잘 일치하는 요약을 생성했다.
  • 출력 길이에 관계없이 일관된 성능을 유지했으며, 짧은(TL;DR) 및 긴(Synthesis) 출력 모두에서 향상된 성능를 보였다.
  • 제한 없음 검색 제도에서 가장 뛰어난 성능을 기록했으며, 원천 시스템적 리뷰가 96.5%의 경우에 검색되었다.
  • 메트릭 순위의 괴리—예를 들어, Elicit이 BERTScore와 ROUGE-L에서 Clinfo.ai를 앞서지만, Clinfo.ai가 METEOR와 CTC(SF)에서 뛰어난 성능—는 자동화된 메트릭의 한계를 드러내며, 다중 메트릭 평가의 필요성을 강조한다.
Figure 2: Clinfo.ai: A RetA LLM system for retrieving and summarizing scientific articles
Figure 2: Clinfo.ai: A RetA LLM system for retrieving and summarizing scientific articles

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.