[논문 리뷰] Knowledge Sharing in Manufacturing using Large Language Models: User Evaluation and Model Benchmarking
이 논문은 공장 문서와 이슈 보고서를 활용하여 운영자 쿼리에 대한 정보를 검색하고 답변하는 대규모 언어 모델(Large Language Model, LLM) 기반 시스템을 제시한다. 이는 제조 분야의 지식 공유를 향상시킨다. GPT-4는 사실성과 간결성 측면에서 다른 모델들을 앞서며, StableBeluga2와 같은 오픈소스 모델은 더 나은 데이터 프라이버시와 맞춤형 설정을 제공하면서도 뛰어난 성능을 보였지만, 사용자들은 여전히 전문가가 이용 가능한 경우 인간 전문가를 선호했다.
Recent advances in natural language processing enable more intelligent ways to support knowledge sharing in factories. In manufacturing, operating production lines has become increasingly knowledge-intensive, putting strain on a factory's capacity to train and support new operators. This paper introduces a Large Language Model (LLM)-based system designed to retrieve information from the extensive knowledge contained in factory documentation and knowledge shared by expert operators. The system aims to efficiently answer queries from operators and facilitate the sharing of new knowledge. We conducted a user study at a factory to assess its potential impact and adoption, eliciting several perceived benefits, namely, enabling quicker information retrieval and more efficient resolution of issues. However, the study also highlighted a preference for learning from a human expert when such an option is available. Furthermore, we benchmarked several commercial and open-sourced LLMs for this system. The current state-of-the-art model, GPT-4, consistently outperformed its counterparts, with open-source models trailing closely, presenting an attractive option given their data privacy and customization benefits. In summary, this work offers preliminary insights and a system design for factories considering using LLM tools for knowledge management.
연구 동기 및 목표
- 지식 집약적인 제조 환경에서의 비효율적 지식 이관 문제를 해결하기 위해.
- 공장 문서와 이슈 보고서에서 관련 정보를 검색하여 운영자 쿼리에 답변하는 LLM 기반 시스템을 개발하고 평가하기 위해.
- 제조 분야의 도메인 특화 지식 검색을 위한 닫힌 소스(GPT-4, GPT-3.5 등)와 개방형 소스(StableBeluga2, Llama2 등) LLM 모델을 비교 평가하기 위해.
- 실제 공장 환경에서 사용자 인식과 시스템의 사용성, 신뢰성, 효율성, 안전성에 초점을 맞춰 평가하기 위해.
제안 방법
- 시스템은 공장 문서와 이슈 보고서를 수신한 후, 벡터 임bedding 기반으로 사용자 쿼리에 적합한 맥락을 검색한다.
- 검색된 맥락을 LLM 프롬프트에 통합하여 답변을 생성하는 검색 증강 생성(Retrieval-Augmented Generation, RAG) 기반 접근법을 사용한다.
- GPT-4, GPT-3.5, StableBeluga2, Llama2 등 다양한 LLM 모델을 20개의 표준화된 프롬프트를 통해 평가하였다.
- 공장 관리자들이 운영자 쿼리를 시뮬레이션하여 수행한 사용자 평가를 통해 응답 품질, 처리 속도, 사용성 등을 평가하였다.
- 한 명의 코더가 사실성, 완전성, 환상 여부를 기준으로 응답을 평가하였으며, 각 모델 간 비교를 위해 점수를 정규화하였다.
- 모델 간 비교를 위해 일관된 프롬프트와 유사한 초모수(예: 온도)를 사용하였지만, 모든 모델에 대해 현지 호스팅이 가능하지는 않았다.
실험 결과
연구 질문
- RQ1닫힌 소스 및 오픈소스 모델 모두가 제조 문서에서 정확하고 맥락에 부합하는 답변을 검색하고 생성하는 데 얼마나 효과적인가?
- RQ2인간 전문가와 비교할 때, 제조 현장 종사자들은 LLM 기반 지식 시스템의 사용성, 신뢰성, 안전성에 대해 어떻게 평가하는가?
- RQ3운영자들이 LLM 기반 도구를 실제로 수용하고 신뢰할 수 있도록 하기 위해 필요한 주요 사용성 및 功能 개선 사항은 무엇인가?
- RQ4GPT-4와 같은 전용 모델에 비해 오픈소스 모델인 StableBeluga2가 실제 제조 지식 검색 작업에서 성능을 얼마나 충족하는가?
- RQ5응답 속도, 완전성, 사실성 측면에서 시스템의 성능은 인간 전문가 상담과 비교해 어느 정도인가?
주요 결과
- GPT-4는 사실성, 완전성, 환상 최소화 측면에서 모든 평가 기준에서 최고의 성능을 보였다.
- StableBeluga2는 오픈소스 모델 중 강력한 대안으로 부상하였으며, GPT-4와 유사한 성능을 보였고, 데이터 프라이버시 및 현지 배포 가능성에서 유리함을 보였다.
- GPT-3.5는 GPT-4보다 더 긴 응답을 생성했지만, 입력 토큰당 비용이 크게 낮아졌으며, 간결성과 약간의 정확도에서 떨어졌다.
- 사용자들은 시스템의 처리 속도와 현대화 잠재력에 찬사를 보였지만, 여전히 전문가가 이용 가능한 경우 인간 전문가를 선호하였으며, 정보 정확성과 안전성에 대한 우려를 제기했다.
- 사용자 연구 결과, 콘텐츠의 구체성, 사용자 인터페이스 개선, 운영자 교육 향상이 신뢰도 향상과 수용률 증가에 핵심적임을 확인하였다.
- 한계점으로는 공장 관리자 수가 적고, 기준 질문 수가 20개로 제한되어 있으며, 평가에 한 명의 코더만 참여하여 결과의 일반화에 주의가 필요하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.