[论文解读] Knowledge Sharing in Manufacturing using Large Language Models: User Evaluation and Model Benchmarking
本文提出了一种基于大语言模型(LLM)的系统,利用工厂文档和问题报告来检索并回答操作员查询,从而提升制造业中的知识共享。GPT-4在事实性和简洁性方面优于其他模型,而开源模型如StableBeluga2则在数据隐私和可定制性方面表现优异,尽管当人类专家可用时,用户仍更倾向于选择专家。
Recent advances in natural language processing enable more intelligent ways to support knowledge sharing in factories. In manufacturing, operating production lines has become increasingly knowledge-intensive, putting strain on a factory's capacity to train and support new operators. This paper introduces a Large Language Model (LLM)-based system designed to retrieve information from the extensive knowledge contained in factory documentation and knowledge shared by expert operators. The system aims to efficiently answer queries from operators and facilitate the sharing of new knowledge. We conducted a user study at a factory to assess its potential impact and adoption, eliciting several perceived benefits, namely, enabling quicker information retrieval and more efficient resolution of issues. However, the study also highlighted a preference for learning from a human expert when such an option is available. Furthermore, we benchmarked several commercial and open-sourced LLMs for this system. The current state-of-the-art model, GPT-4, consistently outperformed its counterparts, with open-source models trailing closely, presenting an attractive option given their data privacy and customization benefits. In summary, this work offers preliminary insights and a system design for factories considering using LLM tools for knowledge management.
研究动机与目标
- 为解决知识密集型制造环境中知识传递效率低下的挑战。
- 开发并评估一种基于大语言模型的系统,该系统能从工厂文档和问题报告中检索相关信息,以回答操作员查询。
- 对闭源模型(如GPT-4、GPT-3.5)和开源模型(如StableBeluga2、Llama2)在制造业领域特定知识检索中的表现进行基准测试。
- 在真实工厂环境中评估用户对系统信任度、效率和安全性的感知与可用性。
提出的方法
- 系统接收工厂文档和问题报告,利用向量嵌入技术检索与用户查询相关的上下文。
- 采用检索增强生成(RAG)方法,将检索到的上下文注入大语言模型提示中以生成答案。
- 通过标准化提示对多种大语言模型(包括GPT-4、GPT-3.5、StableBeluga2和Llama2)在20个查询上进行了评估。
- 通过工厂经理模拟操作员查询的方式开展用户评估,评估内容包括响应质量、响应速度和可用性。
- 基准测试由单一编码者对响应的事实性、完整性和幻觉现象进行评估,并对各模型的得分进行归一化处理。
- 研究采用固定提示和相似的超参数(如温度)以确保模型间的可比性,尽管并非所有模型都支持本地部署。
实验结果
研究问题
- RQ1不同大语言模型——包括闭源和开源模型——在从制造文档中检索并生成准确、上下文相关答案方面的有效性如何?
- RQ2与咨询人类专家相比,工厂人员如何看待基于大语言模型的知识系统的可用性、可靠性和安全性?
- RQ3为提升操作员在制造业环境中对大语言模型工具的信任度和采纳率,关键的可用性和功能性改进有哪些?
- RQ4在真实世界制造业知识检索任务中,开源大语言模型如StableBeluga2在性能上能在多大程度上匹配专有模型如GPT-4?
- RQ5与人类专家咨询相比,该系统在响应速度、完整性和事实准确性方面的表现如何?
主要发现
- GPT-4在所有评估标准下表现最佳,包括事实性、完整性以及幻觉现象最少。
- StableBeluga2作为开源模型表现出色,性能接近GPT-4,同时在数据隐私和本地部署方面具有优势。
- GPT-3.5生成的响应比GPT-4更冗长,但每输入token的成本显著更低,尽管其简洁性稍差且准确性略低。
- 用户赞赏系统响应速度快以及现代化潜力,但当人类专家可用时,仍一致更倾向于选择专家,主要担忧信息准确性和安全性。
- 用户研究揭示,提升内容具体性、用户界面设计以及操作员培训是增强信任度和采纳率的关键。
- 局限性包括工厂经理样本量较小、基准问题集范围较窄,以及仅由单一编码者进行评估,提示结果推广时需谨慎。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。