[論文レビュー] Knowledge Sharing in Manufacturing using Large Language Models: User Evaluation and Model Benchmarking
本稿では、工場の文書および障害報告書を用いてオペレータの質問を検索・回答する大規模言語モデル(LLM)ベースのシステムを提示する。このシステムにより、製造業における知識共有が向上する。GPT-4は事実性および簡潔さにおいて他のモデルを上回ったが、StableBeluga2などのオープンソースモデルも、データの機密性とカスタマイズ性に優れる反面、依然として人間の専門家を好むユーザーが多かった。
Recent advances in natural language processing enable more intelligent ways to support knowledge sharing in factories. In manufacturing, operating production lines has become increasingly knowledge-intensive, putting strain on a factory's capacity to train and support new operators. This paper introduces a Large Language Model (LLM)-based system designed to retrieve information from the extensive knowledge contained in factory documentation and knowledge shared by expert operators. The system aims to efficiently answer queries from operators and facilitate the sharing of new knowledge. We conducted a user study at a factory to assess its potential impact and adoption, eliciting several perceived benefits, namely, enabling quicker information retrieval and more efficient resolution of issues. However, the study also highlighted a preference for learning from a human expert when such an option is available. Furthermore, we benchmarked several commercial and open-sourced LLMs for this system. The current state-of-the-art model, GPT-4, consistently outperformed its counterparts, with open-source models trailing closely, presenting an attractive option given their data privacy and customization benefits. In summary, this work offers preliminary insights and a system design for factories considering using LLM tools for knowledge management.
研究の動機と目的
- 知識集約的な製造環境における非効率な知識移転の課題に対処すること。
- 工場の文書および障害報告書から関連情報を検索し、オペレータの質問に回答するLLM駆動のシステムを開発・評価すること。
- 製造分野特有の知識検索において、閉鎖型(例:GPT-4、GPT-3.5)およびオープンソース型(例:StableBeluga2、Llama2)LLMをベンチマークすること。
- 実際の工場環境におけるシステムの信頼性、効率性、安全性に焦点を当て、ユーザーの認識と使いやすさを評価すること。
提案手法
- システムは工場の文書および障害報告書を入力とし、ベクトル埋め込みを用いてユーザーの質問に該当する文脈を検索する。
- 検索拡張生成(RAG)アプローチを採用し、取得した文脈をLLMのプロンプトに組み込んで回答を生成する。
- GPT-4、GPT-3.5、StableBeluga2、Llama2といった複数のLLMを、20件の質問に対して標準化されたプロンプトで評価した。
- 工場マネージャーを対象にユーザー評価を実施し、回答の質、速度、使いやすさを評価した。
- ベンチマークでは、1名のコーダーが事実性、包括性、虚構の有無について評価し、各モデル間でスコアを正規化した。
- 研究では、比較可能性を確保するため、すべてのモデルで固定プロンプトと類似したハイパーパrameter(例:温度)を採用したが、すべてのモデルでローカルホスティングを実施することは不可能であった。
実験結果
リサーチクエスチョン
- RQ1閉鎖型およびオープンソース型のさまざまなLLMは、製造業文書から正確で文脈的に関連性のある回答を検索・生成する上で、どの程度効果的か?
- RQ2人間の専門家に相談するのと比較して、工場の従業員はLLMベースの知識システムの使いやすさ、信頼性、安全性をどのように評価するか?
- RQ3オペレータの採用およびLLM駆動ツールに対する信頼を高めるために、どのような使いやすさおよび機能改善が必要か?
- RQ4StableBeluga2のようなオープンソースLLMは、GPT-4のような特許型モデルと比較して、実世界の製造業知識検索タスクでどの程度のパフォーマンスを示すか?
- RQ5応答速度、包括性、事実性の観点から、システムのパフォーマンスは人間の専門家に相談するのと比較してどの程度か?
主な発見
- GPT-4は、事実性、包括性、および幻覚の最小化というすべての評価基準で最高のパフォーマンスを示した。
- StableBeluga2は、オープンソース型の強力な代替手段として浮上し、GPT-4とほぼ同等のパフォーマンスを示したが、データの機密性とローカルデプロイメントの利点を有していた。
- GPT-3.5はGPT-4よりも冗長な回答を生成したが、入力トークンあたりのコストは著しく低く抑えられ、やや不正確で、やや不簡潔であった。
- ユーザーはシステムの高速性と近代化の可能性に満足していたが、常に人間の専門家を好んでおり、情報の正確性と安全性に関する懸念を示した。
- ユーザー研究から、コンテンツの的を射た明確さ、ユーザーインターフェース、およびオペレータのトレーニングの改善が、信頼性と採用を高めるために不可欠であることが明らかになった。
- 制限事項として、工場マネージャーのサンプルサイズが小さく、ベンチマーク用の質問が20件に限定されており、評価に1名のコーダーしか使用しなかったため、結果の一般化には注意が必要である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。