Skip to main content
QUICK REVIEW

[논문 리뷰] ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems

Jon Saad-Falcon, Omar Khattab|arXiv (Cornell University)|2023. 11. 16.
Power Systems and Technologies인용 수 4
한 줄 요약

ARES는 합성 데이터와 미세조정된 경량 LLM 심판을 사용하여 문맥 관련성, 답변 충실도, 답변 관련성을 평가하는 RAG 시스템을 위한 자동 평가 프레임워크이다. 소수의 150개의 인간 레이블 데이터 포인트만으로도 few-shot 프ом프팅, 대비 미세조정, 예측 기반 추론(PPI)을 결합하여 높은 정확도를 달성하며, 평균적으로 문맥 관련성 평가에서 RAGAS를 59.29점, 답변 관련성 평가에서 14.4점 뛰어넘는 성능을 보인다.

ABSTRACT

Evaluating retrieval-augmented generation (RAG) systems traditionally relies on hand annotations for input queries, passages to retrieve, and responses to generate. We introduce ARES, an Automated RAG Evaluation System, for evaluating RAG systems along the dimensions of context relevance, answer faithfulness, and answer relevance. By creating its own synthetic training data, ARES finetunes lightweight LM judges to assess the quality of individual RAG components. To mitigate potential prediction errors, ARES utilizes a small set of human-annotated datapoints for prediction-powered inference (PPI). Across eight different knowledge-intensive tasks in KILT, SuperGLUE, and AIS, ARES accurately evaluates RAG systems while using only a few hundred human annotations during evaluation. Furthermore, ARES judges remain effective across domain shifts, proving accurate even after changing the type of queries and/or documents used in the evaluated RAG systems. We make our code and datasets publicly available on Github.

연구 동기 및 목표

  • RAG 시스템 평가에 있어 높은 비용과 낮은 확장성 문제를 해결하기 위해.
  • 도메인 이동에도 불구하고 높은 정확도를 유지하는 자동화되고 데이터 효율적인 평가 프레임워크를 개발하기 위해.
  • 경량 LLM 심판과 최소한의 인간 감독을 통해 RAG 구성 요소에 정밀하고 통계적으로 기반한 점수를 제공하기 위해.
  • 합성 데이터를 통해 특정 RAG 파이프라인에 맞게 LLM 심판을 맞춤화함으로써 수작업으로 만든 프롬프트에 대한 의존도를 줄이기 위해.
  • 예측 기반 추론(PPI)을 통해 평가 점수의 신뢰구간을 제공함으로써 신뢰성을 향상시키기 위해.

제안 방법

  • ARES는 언어 모델을 사용하여 도메인 내 문장에서 합성된 질문-답변 쌍을 생성함으로써 전문화된 LLM 심판의 데이터 효율적 훈련을 가능하게 한다.
  • 대비 학습 목표를 사용하여 세 개의 경량 LLM 심판을 미세조정하여 문맥 관련성, 답변 충실도, 답변 관련성 분류를 수행한다.
  • 예측 기반 추론(PPI)은 높은 정확도의 LLM 예측과 150개 이상의 인간 레이블 데이터 포인트를 조합하여 평가 점수의 신뢰구간을 생성한다.
  • 합성 데이터 생성 중에 도메인 내 질의 및 답변의 few-shot 예시를 프롬프트로 사용하여 도메인 일치를 보장한다.
  • 프레임워크는 미세조정된 심판의 기초 모델로 DeBERTa-v3-Large를 활용하며, KILT 및 SuperGLUE 벤치마크에서 성능을 검증한다.
  • GPT-4는 인간 레이블보다 저비용 대안으로 합성 레이블을 생성하며, 생성된 레이블 수가 증가할수록 성능이 향상된다.
Figure 1: Overview of ARES : As inputs, the ARES pipeline requires an in-domain passage set, a human preference validation set of 150 annotated datapoints or more, and five few-shot examples of in-domain queries and answers, which are used for prompting LLMs in synthetic data generation. To prepare
Figure 1: Overview of ARES : As inputs, the ARES pipeline requires an in-domain passage set, a human preference validation set of 150 annotated datapoints or more, and five few-shot examples of in-domain queries and answers, which are used for prompting LLMs in synthetic data generation. To prepare

실험 결과

연구 질문

  • RQ1소수의 인간 레이블(200개 이하)만으로도 자동 RAG 평가 프레임워크가 높은 정확도를 달성할 수 있는가?
  • RQ2합성 데이터 생성과 대비 미세조정을 조합하여 RAG 평가를 위한 전문화된 LLM 심판을 훈련하는 데 얼마나 효과적인가?
  • RQ3예측 기반 추론(PPI)이 LLM 기반 평가 점수의 신뢰성과 정밀도를 얼마나 향상시키는가?
  • RQ4GPT-4가 생성한 레이블이 인간 레이블 기반 선호도 데이터를 대체할 수 있으며 평가 정확도를 유지하는가?
  • RQ5ARES 심판은 도메인 외부 질의 또는 문서를 평가할 때 도메인 이동에 얼마나 강건한가?

주요 결과

  • ARES는 KILT 및 SuperGLUE 벤치마크 6개에서 평균적으로 문맥 관련성 평가 정확도에서 RAGAS를 59.29점 뛰어넘는다.
  • 동일한 벤치마크에서 ARES는 답변 관련성 평가에서 평균적으로 RAGAS보다 14.4점 높은 정확도를 달성한다.
  • MultiRC 데이터셋에서 ARES는 문맥 관련성과 답변 관련성 각각 페어슨 상관계수 0.28을 기록하여 인간 선호도와 강한 일치를 보인다.
  • GPT-4가 생성한 레이블을 인간 레이블 대체로 사용할 경우, NQ에서 문맥 관련성에 대해 페어슨 상관계수 0.78, 답변 관련성에 대해 0.72를 기록하며 최소한의 인간 입력으로도 뛰어난 성능을 유지한다.
  • PPI의 신뢰구간 범위는 데이터셋 평균 8.3%로 평가 점수에 대한 신뢰할 수 있는 통계적 경계를 보여준다.
  • ARES는 도메인 이동에 대해 일관된 성능을 유지하며, T-Rex(KILT)와 CodeSearchNet에서 각각 페어슨 상관계수 0.38과 0.28을 기록하여 일반화 능력을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.