Skip to main content
QUICK REVIEW

[論文レビュー] Evaluating the Efficacy of Open-Source LLMs in Enterprise-Specific RAG Systems: A Comparative Study of Performance and Scalability

B Gautam, Anupam Purwar|arXiv (Cornell University)|Jun 17, 2024
Semantic Web and Ontologies被引用数 4
ひとこと要約

本研究では、企業のウェブサイトからスクレイピングした特許情報データを用いて、業界固有のRAGシステムにおけるオープンソースLLM(Llama3およびMistral)の評価を実施した。その結果、正解とのコサイン類似度(CSGA)という安定した指標を用いることで、GPT-4と同等の性能を達成するオープンソースモデルの有効性が示された。また、コンテキスト長(top-k)の変更が回答品質にほとんど影響しないことから、Llama3-8Bのような小規模モデルが、Mistral-8x7Bのような大規模モデルよりもドメイン特化型QAタスクで優れた性能を発揮することが示唆された。

ABSTRACT

This paper presents an analysis of open-source large language models (LLMs) and their application in Retrieval-Augmented Generation (RAG) tasks, specific for enterprise-specific data sets scraped from their websites. With the increasing reliance on LLMs in natural language processing, it is crucial to evaluate their performance, accessibility, and integration within specific organizational contexts. This study examines various open-source LLMs, explores their integration into RAG frameworks using enterprise-specific data, and assesses the performance of different open-source embeddings in enhancing the retrieval and generation process. Our findings indicate that open-source LLMs, combined with effective embedding techniques, can significantly improve the accuracy and efficiency of RAG systems, offering a viable alternative to proprietary solutions for enterprises.

研究の動機と目的

  • 特許情報データを用いた企業特化型RAGシステムにおけるオープンソースLLMのパフォーマンスとスケーラビリティを評価すること。
  • GPT-4などの特許モデルと比較して、オープンソースLLMおよび埋め込み表現の正確性と効率性を評価すること。
  • 企業環境におけるRAGの回答品質を測るための最も効果的な評価指標を特定すること。
  • 企業データを用いたRAGシステムにおける最適なハイパーパrameter(例:top-k)を特定すること。
  • 高価なGPUインフラストラクチャを必要としないオープンソースLLMが、コスト効率よくスケーラブルかつ正確なRAGソリューションを提供可能であることを実証すること。

提案手法

  • 企業特化型のデータを企業のウェブサイトから収集し、オープンソースの埋め込み表現を用いてドメイン特化型のベクトルデータベースを構築した。
  • 密度ベクトル検索による検索と生成型LLM(Llama3-8BおよびMistral-8x7B)を統合したRAGフレームワークを実装した。
  • 複数の指標を用いて回答品質を評価した:正解とのコサイン類似度(CSGA)、ユニグラムの適合率・再現率、およびDeepevalの文脈的再現率・適合率。
  • top-kパラメータを系統的に変化させ、検索コンテキスト長が回答品質に与える影響を評価した。
  • スパarsity(疎)な事実、スパarsity(疎)な推論、ドンシティ(密)な事実、ドンシティ(密)な推論の4カテゴリに分類された質問を用いて、異なる質問タイプにおけるモデルの挙動を評価した。
  • 推論遅延と計算コストを、 perplexity API を用いてオープンソースモデルとGPT-3.5を比較した。

実験結果

リサーチクエスチョン

  • RQ1企業特化型RAGタスクにおいて、オープンソースLLMはGPT-4のような特許モデルと比較して正確性と効率性の面でどの程度の差があるか?
  • RQ2RAGの回答品質を測る指標として(例:CSGA、ユニグラム適合率・再現率、Deepeval)、どの指標が最も信頼性があるか?
  • RQ3オープンソースLLMを企業データで使用するRAGシステムにおいて、検索のtop-k値の最適値は何か?
  • RQ4top-kの値を大きくしてコンテキスト長を延ばすことで、異なるLLMおよび質問タイプにおいて回答品質が顕著に向上するか?
  • RQ5高価なGPUインフラストラクチャを必要とせず、オープンソースLLMが商業モデルと同等の性能を達成できるか?

主な発見

  • Llama3-8BなどのオープンソースLLMは、正解とのコサイン類似度(CSGA)という指標で測定した場合、GPT-4と同等の回答品質を達成しており、これはさまざまなtop-k値においても安定している。
  • CSGAは、異なる質問やtop-k設定においても最小限のばらつき(通常0.5前後、最大1)を示しており、RAG評価における信頼性と一貫性の高い指標であることが示された。
  • ユニグラム適合率および再現率は顕著なばらつきを示しており(平均で約1の変化、最大で2)、CSGAに比べて回答品質の評価にはやや信頼性が低いことが示唆された。
  • top-kを増加させても回答品質に顕著な向上が見られず、CSGAスコアはほとんど変化しなかったことから、この設定では大規模なコンテキスト窓は必要ないことが示された。
  • Llama3-8Bは、パrameter数が少ないにもかかわらず、推論が密な質問および推論が疎な質問においてMistral-8x7Bを上回った。これは、ドメイン特化型RAGタスクにおいてモデルアーキテクチャと効率性がサイズよりも重要である可能性を示唆している。
  • Llama3およびMistralは、perplexity API を用いてGPT-3.5と比較したところ、推論時間で約50%短縮した。これは、高価なGPUコストを伴わず、企業環境への展開においても強力なスケーラビリティと効率性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。