[論文レビュー] ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems
ARES は、合成データと微調整された軽量 LLM 評価者を用いて文脈の関連性、回答の忠実性、回答の関連性を評価する、リtrieval-augmented generation (RAG) システム向けの自動評価フレームワークである。少額の 150 件の人的アノテーションデータポイントのみで、few-shot プロンプト、対照的微調整、予測駆動型推論 (PPI) を組み合わせることで高い正確性を達成し、文脈関連性と回答関連性の評価において平均で RAGAS を 59.29 および 14.4 パcentポイント上回った。
Evaluating retrieval-augmented generation (RAG) systems traditionally relies on hand annotations for input queries, passages to retrieve, and responses to generate. We introduce ARES, an Automated RAG Evaluation System, for evaluating RAG systems along the dimensions of context relevance, answer faithfulness, and answer relevance. By creating its own synthetic training data, ARES finetunes lightweight LM judges to assess the quality of individual RAG components. To mitigate potential prediction errors, ARES utilizes a small set of human-annotated datapoints for prediction-powered inference (PPI). Across eight different knowledge-intensive tasks in KILT, SuperGLUE, and AIS, ARES accurately evaluates RAG systems while using only a few hundred human annotations during evaluation. Furthermore, ARES judges remain effective across domain shifts, proving accurate even after changing the type of queries and/or documents used in the evaluated RAG systems. We make our code and datasets publicly available on Github.
研究の動機と目的
- RAG システムの人的アノテーション評価における高コストと低スケーラビリティの問題に対処すること。
- ドメインシフトに対しても高い正確性を維持する、自動的でデータ効率の良い評価フレームワークの開発。
- 軽量 LLM 評価者と最小限の人的監視を用いて、RAG コンponent の正確で統計的根拠に基づいたスコアリングを可能にすること。
- 手作業で作成されたプロンプトに依存するのを減らし、合成データを用いて特定の RAG パイプラインに適合した LLM 評価者を調整すること。
- 予測駆動型推論 (PPI) を用いて評価スコアの信頼区間を提供することで、信頼性を高めること。
提案手法
- ARES は、ドメイン内ドキュメントから言語モデルを用いて合成された質問-回答ペアを生成し、特定の LLM 評価者をデータ効率よく訓練する。
- 対照的学習の目的関数を用いて、3 つの軽量 LLM 評価者を微調整し、文脈の関連性、回答の忠実性、回答の関連性を分類する。
- 予測駆動型推論 (PPI) は、高精度な LLM の予測と 150 件以上の人的アノテーションデータポイントを組み合わせ、評価スコアの信頼区間を生成する。
- ドメイン内クエリと回答の few-shot 例を用いて、合成データ生成時の LLM プロンプトを調整し、ドメイン整合性を確保する。
- フレームワークは、微調整された評価者のベースモデルとして DeBERTa-v3-Large を使用し、KILT および SuperGLUE ベンチマークで性能を検証する。
- GPT-4 を用いて合成ラベルを生成し、人的アノテーションの低コスト代替手段とする。ラベル生成数が増えるほど性能が向上する。

実験結果
リサーチクエスチョン
- RQ1自動 RAG 評価フレームワークは、人的ラベル例が 200 件未満の状況でも高い正確性を達成できるか?
- RQ2合成データ生成と対照的微調整を組み合わせることで、RAG 評価向けに特化した LLM 評価者を効果的に訓練できるか?
- RQ3予測駆動型推論 (PPI) は、LLM 基盤の評価スコアの信頼性と正確性をどの程度向上させるか?
- RQ4人的アノテーションの好みデータに代えて GPT-4 が生成したラベルを用いても、評価の正確性を維持できるか?
- RQ5ARES 評価者では、ドメインシフトに対してどの程度の頑健性を示せるか?特に、ドメイン外クエリやドキュメントでの RAG システム評価において。
主な発見
- ARES は、6 つの KILT および SuperGLUE データセットで、文脈関連性評価の正確性において平均で RAGAS を 59.29 パーセンテージポイント上回った。
- 同じベンチマークで、回答関連性評価において ARES は平均で RAGAS より 14.4 パーセンテージポイント高い正確性を達成した。
- MultiRC データセットでは、ARES は文脈関連性と回答関連性の両方で Kendall’s tau 0.28 を達成し、人的好みと強い整合性を示した。
- 人的アノテーションの代わりに GPT-4 が生成したラベルを用いた場合、NQ では文脈関連性で Kendall’s tau 0.78、回答関連性で 0.72 を達成し、人的入力が最小限でも高い性能を示した。
- PPI の信頼区間の平均幅は、全データセットで 8.3% であり、評価スコアの信頼できる統計的境界を示した。
- ARES はドメインシフトに対しても一貫した性能を維持し、T-Rex (KILT) および CodeSearchNet での評価でも、それぞれ Kendall’s tau 0.38 および 0.28 を達成し、汎化能力を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。