[论文解读] Evaluating the Efficacy of Open-Source LLMs in Enterprise-Specific RAG Systems: A Comparative Study of Performance and Scalability
本研究使用从公司网站抓取的专有数据,在企业特定的RAG系统中评估开源大语言模型(Llama3 和 Mistral)。研究发现,使用真实答案余弦相似度(CSGA)作为稳定指标时,开源模型的性能可与GPT-4相媲美;上下文长度(top-k)对答案质量影响极小,表明在特定领域问答任务中,较小的模型如Llama3-8B 可能优于更大的模型如Mistral-8x7B。
This paper presents an analysis of open-source large language models (LLMs) and their application in Retrieval-Augmented Generation (RAG) tasks, specific for enterprise-specific data sets scraped from their websites. With the increasing reliance on LLMs in natural language processing, it is crucial to evaluate their performance, accessibility, and integration within specific organizational contexts. This study examines various open-source LLMs, explores their integration into RAG frameworks using enterprise-specific data, and assesses the performance of different open-source embeddings in enhancing the retrieval and generation process. Our findings indicate that open-source LLMs, combined with effective embedding techniques, can significantly improve the accuracy and efficiency of RAG systems, offering a viable alternative to proprietary solutions for enterprises.
研究动机与目标
- 评估开源大语言模型在企业特定RAG系统中使用专有数据时的性能与可扩展性。
- 比较开源大语言模型及嵌入模型与GPT-4等专有模型在准确率与效率方面的表现。
- 识别在企业环境中衡量RAG答案质量最有效的评估指标。
- 确定使用企业数据集时RAG系统最优的超参数(如top-k)。
- 证明开源大语言模型可在无需高端GPU基础设施的情况下,实现成本效益高、可扩展且准确的RAG解决方案。
提出的方法
- 从公司网站收集企业特定数据,使用开源嵌入模型构建领域特定的向量数据库。
- 实现一个RAG框架,集成通过密集向量搜索实现的检索模块与生成式大语言模型(Llama3-8B 和 Mistral-8x7B)。
- 使用多种指标评估答案质量:与真实答案的余弦相似度(CSGA)、unigram精确率/召回率,以及Deepeval的上下文召回率/精确率。
- 系统性地调整top-k参数,评估检索上下文长度对答案质量的影响。
- 采用四类问题分类(稀疏事实型、稀疏推理型、密集事实型、密集推理型)评估模型在不同类型问题上的表现。
- 使用perplexity API测量推理延迟与计算成本,比较开源模型与GPT-3.5的性能。
实验结果
研究问题
- RQ1在企业特定的RAG任务中,开源大语言模型与GPT-4等专有模型在准确率与效率方面如何比较?
- RQ2哪些评估指标(如CSGA、unigram精确率/召回率、Deepeval)在衡量RAG答案质量方面最为可靠?
- RQ3在使用开源大语言模型处理企业数据时,RAG系统检索的最优top-k值是多少?
- RQ4增加上下文长度(通过提高top-k)是否显著提升不同大语言模型和问题类型下的答案质量?
- RQ5开源大语言模型是否可在无需昂贵GPU基础设施的情况下,实现与商业模型相当的性能?
主要发现
- 如CSGA(与真实答案的余弦相似度)所衡量,Llama3-8B等开源大语言模型的答案质量可与GPT-4相媲美,且在不同top-k值下保持稳定。
- CSGA在不同问题和top-k设置下变化极小(通常约0.5,最大1),表明其是RAG评估中可靠且一致的指标。
- unigram精确率与召回率表现出显著更高的变异性(平均变化接近1,最大达2),表明其在评估答案质量方面不如CSGA可靠。
- 增加top-k并未显著提升答案质量,因为CSGA分数基本保持不变,表明在此设置下大上下文窗口并非有效问答所必需。
- 尽管参数量更少,Llama3-8B在密集推理与稀疏推理问题上均优于Mistral-8x7B,表明在领域特定RAG任务中,模型架构与效率比参数规模更为关键。
- Llama3与Mistral使用perplexity API相比GPT-3.5将推理时间降低了约50%,证明其在无需高端GPU成本的情况下具备出色的可扩展性与效率,适用于企业部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。