Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Benchmarks: Evaluating Embedding Model Similarity for Retrieval Augmented Generation Systems

Laura Caspari, Kanishka Ghosh Dastidar|arXiv (Cornell University)|2024. 07. 11.
Power Systems and Technologies인용 수 4
한 줄 요약

이 논문은 Retrieval-Augmented Generation (RAG) 시스템에서 임bedding 모델 간 유사도를 표현적 유사도(중심화 커널 일치도를 통해)와 기능적 유사도(재현율과 순위 유사도를 통해)로 평가한다. 모델 간 내부 및 외부 가족 군집이 존재하는 것으로 확인되었지만, 특히 대규모 데이터셋에서 낮은 top-k 값에서 검색 유사도의 변동성이 높아, 유사도 군집화가 이루어져도 모델 선택은 여전히 비단순하다는 점을 밝혀냈다.

ABSTRACT

The choice of embedding model is a crucial step in the design of Retrieval Augmented Generation (RAG) systems. Given the sheer volume of available options, identifying clusters of similar models streamlines this model selection process. Relying solely on benchmark performance scores only allows for a weak assessment of model similarity. Thus, in this study, we evaluate the similarity of embedding models within the context of RAG systems. Our assessment is two-fold: We use Centered Kernel Alignment to compare embeddings on a pair-wise level. Additionally, as it is especially pertinent to RAG systems, we evaluate the similarity of retrieval results between these models using Jaccard and rank similarity. We compare different families of embedding models, including proprietary ones, across five datasets from the popular Benchmark Information Retrieval (BEIR). Through our experiments we identify clusters of models corresponding to model families, but interestingly, also some inter-family clusters. Furthermore, our analysis of top-k retrieval similarity reveals high-variance at low k values. We also identify possible open-source alternatives to proprietary models, with Mistral exhibiting the highest similarity to OpenAI models.

연구 동기 및 목표

  • 빠르게 증가하는 선택지 속에서 RAG 시스템에 최적의 임베딩 모델을 선택하는 데 도전하는 것.
  • 벤치마크 점수를 넘어서 표현적 및 기능적(검색) 측면에서 임베딩 유사도를 분석하는 것.
  • 유사한 동작을 보이는 모델 군집을 식별하여 모델 선택을 단순화하고 독점 모델에 대한 정보 기반 대체 모델을 제안하는 것.
  • 모델 유사도가 다양한 데이터셋과 검색 top-k 값에서 일관된지 평가하는 것.

제안 방법

  • 19개의 다른 임베딩 모델이 생성한 임베딩 간 쌍별 유사도를 측정하기 위해 중심화 커널 일치도(Centered Kernel Alignment, CKA)를 사용한다.
  • 다섯 개인 BEIR 데이터셋에서 검색 결과의 기능적 유사도를 평가하기 위해 top-k 검색된 텍스트 청크에 대해 Jaccard 유사도와 순위 유사도를 계산한다.
  • OpenAI, Cohere, Mistral 기반 모델을 포함한 오픈소스 및 독점 모델을 다양한 데이터 분포에서 비교한다.
  • 유사도 패턴의 강건성을 평가하기 위해 다섯 개의 다양한 BEIR 벤치마크 데이터셋을 사용한다.
  • 특히 RAG에서 흔히 사용되는 낮은 k 값에서의 유사도를 분석하여 검색 행동의 안정성을 평가한다.
  • 유사도 점수에 대한 계층적 군집 분석을 통해 모델 군집을 식별하여 모델 선택 및 대체 모델 탐색을 안내한다.
Figure 1. Mean CKA similarity across all five datasets. Models tend to be most similar to models belonging to their own family, though some interesting inter-family patterns are visible as well.
Figure 1. Mean CKA similarity across all five datasets. Models tend to be most similar to models belonging to their own family, though some interesting inter-family patterns are visible as well.

실험 결과

연구 질문

  • RQ1다른 임베딩 모델이 생성한 임베딩은 표현적 측면과 검색 작업에서의 기능적 측면에서 얼마나 유사한가?
  • RQ2아키텍처나 기원에 따라 모델이 가족으로 군집화되는가? 그리고 가족 간 유사성이 두드러지는가?
  • RQ3검색 유사도는 top-k 값에 따라 어떻게 변하는가? 특히 RAG 시스템에서 흔히 사용되는 낮은 k 값에서의 변화는?
  • RQ4OpenAI나 Cohere의 모델과 유사한 성능을 보이는 오픈소스 모델을 식별할 수 있는가?
  • RQ5모델 유사도는 다양한 데이터셋에서 크게 달라지는가? 데이터셋 크기나 도메인에 의해 영향을 받는가?

주요 결과

  • 임베딩 모델은 명확한 내부 가족 군집을 형성하며, 동일 가족에 属하는 모델들(예: BGE, UAE, mxbai)이 CKA와 검색 결과 모두에서 높은 유사도를 보인다.
  • 가족 간 군집도 존재하며, bge-large-en-v1.5, UAE-Large-V1, mxbai-embed-large-v1은 낮은 top-k 값에서도 높은 유사도를 보이는 두드러진 군집을 이룬다.
  • 낮은 top-k 값(예: k=1에서 5)에서 검색 유사도의 변동성이 높으며, 특히 대규모 데이터셋에서 두드러진다. 이는 다양한 모델 간에 검색된 청크가 거의 완전히 다를 수 있음을 시사한다.
  • SFR-Embedding-Mistral은 검색 행동 측면에서 OpenAI 모델과 가장 높은 유사도를 보였지만, 대규모 데이터셋에서 top-10 기준 Jaccard 유사도는 여전히 낮았다.
  • Cohere의 임베딩 모델은 낮은 k에서 다양한 데이터셋 간에 일관되지 않은 유사도를 보였으며, 어떤 오픈소스 모델도 일관된 대체 모델로 부상하지 못했다.
  • 대부분의 모델 쌍에서 top-10 검색 결과는 Jaccard 유사도가 낮거나 중간 수준이었으며, 이는 비록 유사한 임베딩 표현을 가졌더라도 LLM의 검색된 컨텍스트가 상당히 다를 수 있음을 시사한다.
Figure 2. Rank similarity over all $k$ on NFCorpus, comparing gte-large to all other models. Scores are highest and vary most for small $k$ , but then drop quickly before stabilizing for larger $k$ .
Figure 2. Rank similarity over all $k$ on NFCorpus, comparing gte-large to all other models. Scores are highest and vary most for small $k$ , but then drop quickly before stabilizing for larger $k$ .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.