[論文レビュー] Beyond Benchmarks: Evaluating Embedding Model Similarity for Retrieval Augmented Generation Systems
本稿では、Retrieval-Augmented Generation (RAG) システムにおける埋め込みモデルの類似性を、表現的類似性(中央化カーネル整合性(CKA)を用いて)および機能的類似性(ジャカード係数およびランク類似性を用いて)の両面から評価している。モデルの家族内(intra-family)および家族間(inter-family)のクラスタリングが確認されたが、特に大規模データセットにおいて、低k値での検索類似性に顕著なばらつきが認められ、類似性クラスタリングがなされても、モデル選定は依然として非自明であることが示された。
The choice of embedding model is a crucial step in the design of Retrieval Augmented Generation (RAG) systems. Given the sheer volume of available options, identifying clusters of similar models streamlines this model selection process. Relying solely on benchmark performance scores only allows for a weak assessment of model similarity. Thus, in this study, we evaluate the similarity of embedding models within the context of RAG systems. Our assessment is two-fold: We use Centered Kernel Alignment to compare embeddings on a pair-wise level. Additionally, as it is especially pertinent to RAG systems, we evaluate the similarity of retrieval results between these models using Jaccard and rank similarity. We compare different families of embedding models, including proprietary ones, across five datasets from the popular Benchmark Information Retrieval (BEIR). Through our experiments we identify clusters of models corresponding to model families, but interestingly, also some inter-family clusters. Furthermore, our analysis of top-k retrieval similarity reveals high-variance at low k values. We also identify possible open-source alternatives to proprietary models, with Mistral exhibiting the highest similarity to OpenAI models.
研究の動機と目的
- 急速に増加する選択肢の中でのRAGシステムにおける最適な埋め込みモデルの選定という課題に取り組むこと。
- ベンチマークスコアにとどまらず、表現的および機能的(検索)な観点から埋め込み類似性を分析すること。
- 類似した挙動を示すモデルのクラスタリングを同定することで、モデル選定の簡素化および特許権モデルの代替となるインformedな代替案の特定を可能にすること。
- モデル類似性が異なるデータセットおよび検索top-k値の間で一貫しているかどうかを評価すること。
提案手法
- 19種類の異なる埋め込みモデルが生成する埋め込み同士のペアワイズ類似性を測定するため、中央化カーネル整合性(CKA)を採用する。
- 5つのBEIRデータセット上で、RAG検索における機能的類似性を評価する。その際、top-kの検索結果テキストチャンクのジャカード係数およびランク類似性を計算する。
- OpenAI、Cohere、Mistralベースのモデルを含む、オープンソースおよび特許権モデルを、多様なデータ分布において比較する。
- 類似性パターンの頑健性をテストするために、5つの多様なBEIRベンチマークデータセットを用いる。
- 特にRAGで一般的に用いられる低k値(特にkが小さい場合)における類似性を分析し、検索挙動の安定性を評価する。
- 類似性スコアに基づく階層的クラスタリングを用いてモデルクラスタを同定し、モデル選定および代替モデルの発見を支援する。

実験結果
リサーチクエスチョン
- RQ1異なる埋め込みモデルが生成する埋め込みは、表現的および検索タスクにおける機能的類似性においてどの程度類似しているか?
- RQ2アーキテクチャや出典に基づいてモデルが家族に分類されるか?また、顕著な家族間類似性は存在するか?
- RQ3検索類似性はtop-k値にどのように依存するか?特にRAGシステムで一般的に使用される低k値における挙動は?
- RQ4OpenAI や Cohere のような特許権モデルの強力な代替として、オープンソースモデルを特定できるか?
- RQ5モデル類似性は異なるデータセットで顕著に異なるか?また、データセットのサイズやドメインによって影響を受けるか?
主な発見
- 同じ家族に属するモデル(例:BGE、UAE、mxbai)は、CKAおよび検索結果の両方において高い類似性を示し、明確な家族内クラスタを形成している。
- 家族間クラスタが存在し、bge-large-en-v1.5、UAE-Large-V1、mxbai-embed-large-v1は、低k値でも高い類似性を示す顕著なクラスタを形成している。
- 低k値(例:k=1〜5)における検索類似性に顕著なばらつきが認められ、特に大規模データセットにおいて顕著である。これは、異なるモデル間で検索結果のチャンクがほとんど完全に異なる可能性があることを示している。
- SFR-Embedding-Mistralは、検索挙動においてOpenAIのモデルと最も類似しているが、大規模データセットではtop-10におけるジャカード類似性は依然として低い。
- Cohereの埋め込みモデルは、低k値におけるデータセット間での類似性が一貫せず、一貫した代替となるオープンソースモデルは特定されていない。
- ほとんどのモデルペアにおいてtop-10の検索結果は、ジャカード類似性が低~中程度にとどまり、類似した埋め込み表現をもつにもかかわらず、LLMの検索コンテキストが顕著に異なる可能性があることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。