Skip to main content
QUICK REVIEW

[논문 리뷰] CRAG -- Comprehensive RAG Benchmark

Xiao Yang, Kai Sun|arXiv (Cornell University)|2024. 06. 07.
Medical Imaging Techniques and Applications인용 수 7
한 줄 요약

CRAG는 사실적 다이내믹성과 다양성 하에서 사실 확인 가능한 QA를 평가하기 위한 mock 웹 및 KG 검색을 포함하는 4,409-question RAG 벤치마크를 제공하며, 현재 RAG 시스템의 격차를 부각합니다.

ABSTRACT

Retrieval-Augmented Generation (RAG) has recently emerged as a promising solution to alleviate Large Language Model (LLM)'s deficiency in lack of knowledge. Existing RAG datasets, however, do not adequately represent the diverse and dynamic nature of real-world Question Answering (QA) tasks. To bridge this gap, we introduce the Comprehensive RAG Benchmark (CRAG), a factual question answering benchmark of 4,409 question-answer pairs and mock APIs to simulate web and Knowledge Graph (KG) search. CRAG is designed to encapsulate a diverse array of questions across five domains and eight question categories, reflecting varied entity popularity from popular to long-tail, and temporal dynamisms ranging from years to seconds. Our evaluation of this benchmark highlights the gap to fully trustworthy QA. Whereas most advanced LLMs achieve <=34% accuracy on CRAG, adding RAG in a straightforward manner improves the accuracy only to 44%. State-of-the-art industry RAG solutions only answer 63% of questions without any hallucination. CRAG also reveals much lower accuracy in answering questions regarding facts with higher dynamism, lower popularity, or higher complexity, suggesting future research directions. The CRAG benchmark laid the groundwork for a KDD Cup 2024 challenge and attracted thousands of participants and submissions. We commit to maintaining CRAG to serve research communities in advancing RAG solutions and general QA solutions. CRAG is available at https://github.com/facebookresearch/CRAG/.

연구 동기 및 목표

  • 실제 세계 QA 도전을 반영하는 현실적이고 다양하며 지속가능한 RAG 벤치마크의 제작을 촉진합니다.
  • 다섯 개 도메인과 여덟 가지 질문 유형에 걸친 4,409개의 질문으로 구성된 CRAG 데이터셋을 제시합니다.
  • 일관된 비교를 가능하게 하기 위해 환각, 누락, 정답을 구분하는 다중 작업 평가 프레임워크를 제안합니다.
  • 기준 LLM 및 최첨단 RAG 성능을 시연하여 격차와 향후 연구 방향을 식별합니다.

제안 방법

  • 세 가지 검색 태스크를 설계합니다: 웹 검색만, KG와 웹 검색 보강, 더 큰 웹 후보 풀을 사용하는 엔드-투-엔드 RAG.
  • 다섯 도메인과 여덟 가지 질문 유형에 걸친 4,409개의 QA 쌍(KG 기반 및 웹 기반)을 만들어 다양성 있는 동적성 및 인기를 반영합니다.
  • 실제 검색 및 KG 접근을 모의하기 위해 모의 검색 API와 질문당 최대 50개의 웹 페이지를 제공합니다.
  • 네 가지 레이블(완벽, 허용 가능, 누락, 잘못됨)을 가진 점수 체계를 정의하고 환각에 더 큰 패널티를 부과하는 Score h를 계산합니다.
  • 사람 평가와 두 가지 자동 평가 도구(ChatGPT와 Llama 3)를 사용하여 정확도, 환각, 누락 비율을 추정하고 평가자 간 평균치를 보고합니다.

실험 결과

연구 질문

  • RQ1간단한 RAG 구성은 LLM 만 접근법과 비교할 때 CRAG에서 QA 정확도를 어떻게 향상시키는가?
  • RQ2웹 검색, 구조화된 KG 질의, 그리고 더 큰 검색 후보 풀은 다양한 질문 구간에서 정확도와 환각 비율에 어떤 영향을 미치는가?
  • RQ3CRAG에서 현재 RAG 시스템에 가장 도전적인 차원은 어느 것들인가?
  • RQ4CRAG에서 환각 없이 완전히 신뢰할 수 있는 QA를 달성하기 위해 산업계 SOTA RAG 시스템에 남아 있는 격차는 무엇인가?

주요 결과

  • LLM-전용 솔루션은 CRAG에서 최대 34%의 정확도에 도달합니다.
  • 간단한 RAG는 정확도를 최대 44%까지 높입니다.
  • 산업 SOTA RAG 솔루션은 환각 없이 63%의 질문에 답하지만 여전히 개선의 여지가 큽니다.
  • 실시간/빠르게 변화하는 사실, 테일 엔티티, 복잡한 질문(집합, 후처리, 잘못된 전제)에서 성능이 저하됩니다.
  • KG+웹(Task 2)은 일반적으로 웹 전용(Task 1)보다 더 높은 점수를 산출하며 구조화된 데이터가 도움이 되지만 이득은 미미합니다.
  • 엔드-투-엔드 RAG(Task 3)는 Task 2보다 재현율과 성능을 향상시켜 검색 순위의 중요성을 강조합니다.
  • SOTA 시스템은 원시 점수는 더 좋지만 여전히 주목할 만한 환각 비율(17-25%)을 보이며 신뢰성 문제를 부각시킵니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.