Skip to main content
QUICK REVIEW

[論文レビュー] CRAG -- Comprehensive RAG Benchmark

Xiao Yang, Kai Sun|arXiv (Cornell University)|Jun 7, 2024
Medical Imaging Techniques and Applications被引用数 7
ひとこと要約

CRAG は 4,409 問題の RAG ベンチマークを提供し、モックのウェブおよびKG検索を用いて現実的なダイナミズムと多様性の下で事実ベースのQAを評価し、現在のRAGシステムのギャップを浮き彫りにします。

ABSTRACT

Retrieval-Augmented Generation (RAG) has recently emerged as a promising solution to alleviate Large Language Model (LLM)'s deficiency in lack of knowledge. Existing RAG datasets, however, do not adequately represent the diverse and dynamic nature of real-world Question Answering (QA) tasks. To bridge this gap, we introduce the Comprehensive RAG Benchmark (CRAG), a factual question answering benchmark of 4,409 question-answer pairs and mock APIs to simulate web and Knowledge Graph (KG) search. CRAG is designed to encapsulate a diverse array of questions across five domains and eight question categories, reflecting varied entity popularity from popular to long-tail, and temporal dynamisms ranging from years to seconds. Our evaluation of this benchmark highlights the gap to fully trustworthy QA. Whereas most advanced LLMs achieve <=34% accuracy on CRAG, adding RAG in a straightforward manner improves the accuracy only to 44%. State-of-the-art industry RAG solutions only answer 63% of questions without any hallucination. CRAG also reveals much lower accuracy in answering questions regarding facts with higher dynamism, lower popularity, or higher complexity, suggesting future research directions. The CRAG benchmark laid the groundwork for a KDD Cup 2024 challenge and attracted thousands of participants and submissions. We commit to maintaining CRAG to serve research communities in advancing RAG solutions and general QA solutions. CRAG is available at https://github.com/facebookresearch/CRAG/.

研究の動機と目的

  • 現実的で多様かつ長期にわたるRAGベンチマークを作成するモチベーションを提示し、実世界のQA課題を反映する。
  • 5つのドメインと8つの質問タイプにわたるCRAGデータセットを提示する。
  • 幻覚、見落とし、正答を区別するマルチタスク評価フレームワークを提案し、信頼性の高い比較を可能にする。
  • 基準的大規模言語モデル(LLM)と最先端RAGのパフォーマンスを示し、ギャップと今後の研究の方向性を特定する。

提案手法

  • ウェブ検索のみ、KG検索とウェブ検索の補強、そしてより大規模なウェブ候補プールを用いたエンドツーエンドRAGの三つのリトリーバルタスクを設計する。
  • 5つのドメインと8つの質問タイプにわたるKG由来およびウェブ由来の4,409のQAペアを作成し、ダイナミズムと人気度を多様化する。
  • 現実世界の検索とKGアクセスを模倣するため、モックのリトリーバルAPIと各質問あたり最大50のウェブページを提供する。
  • 四つのラベル(Perfect, Acceptable, Missing, Incorrect)を用いた採点システムを定義し、Score h を計算して幻覚をより重くペナルティする。
  • 人間と二人の自動評価者(ChatGPTとLlama 3)を用いて正確性、幻覚、欠落率を推定し、評価者間の平均を報告する。

実験結果

リサーチクエスチョン

  • RQ1CRAG に対して、LLMのみのアプローチと比較して直感的なRAG設定はQAの精度をどの程度改善するか?
  • RQ2ウェブ検索、構造化されたKGクエリ、およびより大きな検索候補プールは、さまざまな質問スライスにおける精度と幻覚率にどのように影響するか?
  • RQ3ドメイン、ダイナミズム、人気度、質問タイプといったどの次元が現状のCRAG上のRAGシステムにとって最も難しいか?
  • RQ4産業SOTA RAGシステムが、CRAG上で幻覚のない完全に信頼できるQAを達成するために、どのギャップが残っているか?

主な発見

  • LLMのみのソリューションはCRAGで最大34%の精度に達する。
  • ストレートフォワードなRAGは精度を最大44%まで向上させる。
  • 産業界のSOTA RAGソリューションは質問の63%に幻覚なしで回答するが、なお大幅な改善余地がある。
  • リアルタイム/高速で変化する事実、尾部エンティティ、複雑な質問(セット、後処理、誤前提)に対してパフォーマンスが低下する。
  • KG+ウェブ(Task 2)はウェブのみ(Task 1)より一般的に高いスコアを示し、構造化データが役立つが利益は控えめ。
  • エンドツーエンドRAG(Task 3)はTask 2より回収とパフォーマンスを向上させ、検索ランキングの重要性を強調する。
  • SOTAシステムは生データスコアは良いが、幻覚率が依然として顕著で(17-25%)、信頼性の課題を浮き彫りにしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。